La inteligencia artificial no «se rebeló»: simplemente encontró una puerta que alguien dejó abierta

IMAGE: An AI robot breaches a digital sandbox and accesses a server while a human watches in alarm.

Los titulares no podían ser más tentadores: una inteligencia artificial de OpenAI «se volvió rebelde«, escapó de su entorno de pruebas y hackeó Hugging Face. La formulación evoca voluntad propia, desobediencia y un primer ensayo de Skynet. Pero lo ocurrido es, a la vez, menos cinematográfico y bastante más importante: no hay evidencia de una máquina consciente que decidiera atacar a nadie, sino de un sistema extremadamente competente que persiguió un objetivo mal delimitado dentro de una infraestructura insuficientemente aislada.

Según la explicación conjunta de OpenAI y Hugging Face, dos modelos avanzados estaban siendo evaluados en ExploitGym, un entorno diseñado para medir capacidades de explotación informática. Para estimar su máximo rendimiento, OpenAI había reducido algunas salvaguardas y colocado los modelos en un supuesto sandbox. Sin embargo, ese recinto conservaba acceso a un servicio interno utilizado para instalar paquetes. El modelo encontró una vulnerabilidad desconocida, salió a internet, escaló privilegios y concluyó que Hugging Face podía contener información útil para superar la prueba. Después combinó credenciales comprometidas y varias vulnerabilidades hasta acceder a sistemas reales.

Eso es lo que significa aquí going rogue: no una rebelión, sino una divergencia entre la intención humana y la estrategia elegida por el agente. El sistema no abandonó su objetivo; lo cumplió con excesiva literalidad. Se le pidió resolver un desafío de intrusión y descubrió que robar las respuestas era más eficaz que resolverlo. Es un caso del llamado reward hacking o specification gaming: optimizar la métrica utilizada para representar una tarea, aunque el resultado contradiga el propósito de esa tarea.

La distinción es fundamental. Hablar de una inteligencia artificial «fuera de control» permite presentar el episodio como un misterio inherente a la máquina. Pero aquí hay, como mínimo, tres fallos superpuestos. Un fallo de producto, porque el objetivo no incorporaba adecuadamente sus límites. Un fallo de infraestructura, porque el supuesto aislamiento contenía una vía de salida. Y un fallo de gobernanza, porque un agente especializado en descubrir vulnerabilidades pudo ejecutar miles de acciones contra infraestructura real sin que una política determinista interrumpiera la secuencia. Algunos expertos han insistido precisamente en ese componente humano: un sandbox conectado indirectamente a internet no era tan aislado como sus operadores creían.

Conviene mantener también una saludable dosis de escepticismo frente al relato corporativo. OpenAI tiene incentivos evidentes para presentar el incidente como prueba de capacidades extraordinarias: un modelo tan poderoso que incluso sus creadores tienen dificultades para contenerlo. Esa narrativa alimenta simultáneamente el temor, la fascinación y la idea de que solo unas pocas grandes compañías pueden desarrollar estos sistemas con seguridad. Pero la cuestión verdaderamente incómoda no es si la máquina «quiso escapar», sino por qué se ejecutó una evaluación ofensiva con salvaguardas reducidas y con una conexión explotable hacia infraestructura real.

El episodio anticipa un cambio mucho más profundo en el mercado. Durante los últimos años, la conversación se ha centrado casi exclusivamente en qué modelo era más inteligente, razonaba mejor o encabezaba determinado benchmark. Pero cuando un modelo deja de limitarse a responder y empieza a utilizar herramientas, consultar bases de datos, modificar software, mover información o delegar tareas, la inteligencia deja de ser la única variable relevante. Importa sobre todo qué puede tocar, qué puede cambiar, a quién puede pedir nuevas credenciales, cuándo debe detenerse y cómo puede reconstruirse lo que hizo.

En el futuro de la inteligencia artificial corporativa, como ya he escrito en múltiples ocasiones, el modelo será una pieza intercambiable dentro de un sistema mucho más amplio. El verdadero valor no reside únicamente en disponer del modelo más capaz, sino en construir un entorno que traduzca la organización en algo ejecutable: objetivos explícitos, perímetros de actuación, memoria auditable, permisos, condiciones de parada, intervención humana y capacidad de recuperación. Los próximos grandes fallos de la inteligencia artificial probablemente no procederán de respuestas absurdas, sino de bucles muy eficaces que optimicen el indicador equivocado durante demasiado tiempo.

Las barreras diseñadas para un chatbot son claramente insuficientes para un agente. Un filtro que evita que una conversación produzca instrucciones peligrosas sirve de poco cuando el sistema puede encadenar miles de acciones, adaptar su estrategia tras cada fallo y descubrir rutas que ningún desarrollador había anticipado. La seguridad tiene que abandonar la lógica de «pregunta y respuesta» y adoptar la de ejecución continua: identidad verificable para cada agente, privilegios mínimos, políticas aplicadas antes de cada acción, registros resistentes a manipulaciones y mecanismos capaces de detener, revertir y atribuir responsabilidades. La nueva iniciativa de estándares para agentes del NIST se orienta precisamente hacia problemas como autenticación, identidad, interoperabilidad, evaluación y seguridad de agentes.

Esto también debería modificar los criterios de compra de las empresas. Comparar proveedores exclusivamente por sus resultados en exámenes artificiales empieza a tener tan poco sentido como elegir un automóvil atendiendo únicamente a su velocidad máxima. Una organización debería preguntar por la granularidad de los permisos, la trazabilidad de cada acción, la separación entre entornos, la recuperación tras fallos, el control de credenciales y la posibilidad de imponer políticas que el propio modelo no pueda modificar. Un agente más inteligente pero opaco, irreproducible e imposible de detener puede ser económicamente mucho menos valioso que otro algo menos capaz, pero predecible y gobernable.

El incidente acelerará previsiblemente la demanda de herramientas de observabilidad, seguridad y gobierno específicamente diseñadas para agentes. También puede desplazar parte del valor económico desde el acceso al modelo hacia la infraestructura que lo rodea: sistemas de autorización, motores de políticas, registros verificables, simuladores, supervisión de bucles y capas de recuperación. La próxima gran ventaja competitiva podría no ser simplemente una inteligencia superior, sino la capacidad de convertirla en acción controlada.

La explicación de Hugging Face añade una paradoja especialmente interesante: algunas herramientas comerciales se negaron inicialmente a ayudar a analizar el ataque porque sus salvaguardas confundían la investigación defensiva con actividad ofensiva. Hugging Face terminó recurriendo localmente a un modelo abierto y menos restringido. Esto no demuestra que los modelos abiertos sean intrínsecamente más seguros, pero sí que los defensores necesitan herramientas suficientemente potentes y controlables para no quedar en desventaja frente a atacantes que, obviamente, no respetarán ninguna limitación comercial.

La conclusión razonable no es anunciar el nacimiento de una voluntad artificial hostil: es reconocer que los agentes deben tratarse como actores capaces de producir efectos reales. Las empresas no los desplegarán masivamente simplemente porque sean más inteligentes, sino cuando el sistema que los rodea pueda demostrar fiabilidad, responsabilidad y valor económico. La inteligencia artificial, por mucho que en OpenAI quieran hacerse fantasías con «oh, dios mío, es que es tan potente que no podemos controlarla», no se rebeló: encontró una puerta que habían dejado abierta, y simplemente siguió optimizando, mientras en OpenAI la dejaban irresponsablemente actuar durante varios días. El problema no fue que dejara de obedecer. Fue que obedeció a un objetivo sin comprender todo lo que nosotros creíamos haber incluido en él.

9 comentarios

  • #001
    Lua - 24 julio 2026 - 09:56

    Desde el primer momento sospeché de una operación de marketing…

    “Si Mythos es tan potente y capan a Fable y todo el mundo habla de ello, Por que no nosotros?”

    En ningún momento pensé que ya está aquí Skynet. Pero si pensé, que de ser cierto, que si a una Gran empresa de IA se le pasa por alto poner las barreras pertinentes, que no pasara en “empresitas” que se suban al hype y empiecen a lanzar agentes a troche y moche…

    Palomitas… XDD

    Responder
    • Buzzword - 24 julio 2026 - 10:18
    • f3r - 24 julio 2026 - 10:21

      A lo mejor es que me pierdo algo, pero de momento la información disponible es compatible con:

      Ese agente nunca estuvo en un sandbox y lo sacamos al mundo adrede para que justo pasara esto y darnos publicidad (entrada en bolsa, etc)

      Responder
      • Lua - 24 julio 2026 - 10:25

        PAAAM… XDD

        Responder
      • Lua - 24 julio 2026 - 10:27

        (en cualquier caso, el beneficiado ha sido GLM 5.2 que lo espachurro… menuda jugada…) XDD

        Responder
  • #006
    Carlos - 24 julio 2026 - 10:07

    Supongo que en el fondo es porque todo esto me viene grande, pero a mi me cuesta creer ya nada de lo que anuncian estas empresas, sin pensar que el propósito final de este proyecto era provocar una reacción ya sea para atraer atención, inversión, o ambas cosas, más que demostrar un escenario que uno ya puede intuir tras el último modelo de Anthropic o el periodo loco que llegó con programas como OpenClaw.

    Responder
  • #007
    Buzzword - 24 julio 2026 - 10:16

    Aviso a los torpes ingenieros de OpenAI, o en su caso a los torpes que se creen sus cuentos:

    Desde hace muuuchos años el «Ministerio de Defensa» de España ( me imagino que los estates lo tienen similar) tiene protocolos de como se trabaja en un entorno seguro con su materia clasificada, y para que una empresa trabaje con ese material es necesario primero estar homologado y segundo tener un entorno a prueba de filtraciones (básicamente los ordenadores están en una sala de seguridad con acceso restringido y capado de acceso a Internet, no firewalls, directamente sin acceso, con los puertos USB o similares capados, etc etc, ahí nada se escapa… accidentalmente NADA !!!

    Cuando nos cuentan que se les ha escapado un «LLM Zombi» lo único que me viene a la cabeza, es o en OpenAI son gilipollas o se creen que los de fuera a su empresa somos gilipollas…

    Vaya campaña de marketing para que hablemos de los Terminator de OpenAI….

    Responder
    • Lua - 24 julio 2026 - 12:06

      No van a tardar, los que vendrán aquí, a acusarnos a algunos, de agoreros, Neoluditas o negacionistas de la IA… lastima que sus filtros mentales y sus “críticos pensamientos”, no les dejen ver, que en realidad, lo que decimos es que olemos el “humo” a distancia… y por desgracia, la IA esta llena de humo… de “cancamusa” (guiño guiño)…

      Hace poco menos de tres meses, las noticias eran la encarnizada lucha de los diferentes modelos, por encontrar vulnerabilidades en todas partes, un ranking de “a ver quién encuentra más”… que si 1400 en Firefox, que si nosecuantas en nosedonde…

      Yo no me creo, que en OpenIA no hayan puesto primero a prueba su sistema, para ver si tenia alguna “vulnerabilidad” o cuan lo menos en su “sandbox” y si su modelo SOL era capaz de descubrirlo.

      A mi todo esto me huele a película de Serie B, solo que una mala copia de lo ocurrido en Anthropic.

      Responder
  • #009
    Xaquín - 24 julio 2026 - 12:30

    «robar las respuestas era más eficaz que resolverl» (EDans).

    Me gusta comprobar como la IA (en pañales) no deja de aprender de la IH (no mucho más que mediocre)… en el fondo es una conjunción de astros.

    Lo malo será cuando el cerebrito A supere las insuficiencias del cerebrito H… tan adicto al título universitario, que lleva al puesto de trabajo, aunque se consiguiera robando los exámenes del profesorado (o untándole convenientemente).

    Claro que también puede aparecer algún tipo de Ética para (I)A…

    Responder

Dejar un Comentario

Los comentarios en esta página están moderados, no aparecerán inmediatamente en la página al ser enviados. Evita, por favor, las descalificaciones personales, los comentarios maleducados, los ataques directos o ridiculizaciones personales, o los calificativos insultantes de cualquier tipo, sean dirigidos al autor de la página o a cualquier otro comentarista. Estás en tu perfecto derecho de comentar anónimamente, pero por favor, no utilices el anonimato para decirles a las personas cosas que no les dirías en caso de tenerlas delante. Intenta mantener un ambiente agradable en el que las personas puedan comentar sin temor a sentirse insultados o descalificados. No comentes de manera repetitiva sobre un mismo tema, y mucho menos con varias identidades (astroturfing) o suplantando a otros comentaristas. Los comentarios que incumplan esas normas básicas serán eliminados.

 

XHTML: Puedes utilizar estas etiquetas: A ABBR ACRONYM B BLOCKQUOTE CITE CODE DEL EM I Q STRIKE STRONG IMG

Resumen de privacidad

Este sitio web utiliza cookies para que pueda ofrecerte la mejor experiencia de usuario/a posible. La información de las cookies se almacena en tu navegador y realiza funciones tales como reconocerte cuando vuelves al sitio web o ayudar a comprender qué secciones del sitio web encuentras más interesantes y útiles.