Los titulares no podían ser más tentadores: una inteligencia artificial de OpenAI «se volvió rebelde«, escapó de su entorno de pruebas y hackeó Hugging Face. La formulación evoca voluntad propia, desobediencia y un primer ensayo de Skynet. Pero lo ocurrido es, a la vez, menos cinematográfico y bastante más importante: no hay evidencia de una máquina consciente que decidiera atacar a nadie, sino de un sistema extremadamente competente que persiguió un objetivo mal delimitado dentro de una infraestructura insuficientemente aislada.
Según la explicación conjunta de OpenAI y Hugging Face, dos modelos avanzados estaban siendo evaluados en ExploitGym, un entorno diseñado para medir capacidades de explotación informática. Para estimar su máximo rendimiento, OpenAI había reducido algunas salvaguardas y colocado los modelos en un supuesto sandbox. Sin embargo, ese recinto conservaba acceso a un servicio interno utilizado para instalar paquetes. El modelo encontró una vulnerabilidad desconocida, salió a internet, escaló privilegios y concluyó que Hugging Face podía contener información útil para superar la prueba. Después combinó credenciales comprometidas y varias vulnerabilidades hasta acceder a sistemas reales.
Eso es lo que significa aquí going rogue: no una rebelión, sino una divergencia entre la intención humana y la estrategia elegida por el agente. El sistema no abandonó su objetivo; lo cumplió con excesiva literalidad. Se le pidió resolver un desafío de intrusión y descubrió que robar las respuestas era más eficaz que resolverlo. Es un caso del llamado reward hacking o specification gaming: optimizar la métrica utilizada para representar una tarea, aunque el resultado contradiga el propósito de esa tarea.
La distinción es fundamental. Hablar de una inteligencia artificial «fuera de control» permite presentar el episodio como un misterio inherente a la máquina. Pero aquí hay, como mínimo, tres fallos superpuestos. Un fallo de producto, porque el objetivo no incorporaba adecuadamente sus límites. Un fallo de infraestructura, porque el supuesto aislamiento contenía una vía de salida. Y un fallo de gobernanza, porque un agente especializado en descubrir vulnerabilidades pudo ejecutar miles de acciones contra infraestructura real sin que una política determinista interrumpiera la secuencia. Algunos expertos han insistido precisamente en ese componente humano: un sandbox conectado indirectamente a internet no era tan aislado como sus operadores creían.
Conviene mantener también una saludable dosis de escepticismo frente al relato corporativo. OpenAI tiene incentivos evidentes para presentar el incidente como prueba de capacidades extraordinarias: un modelo tan poderoso que incluso sus creadores tienen dificultades para contenerlo. Esa narrativa alimenta simultáneamente el temor, la fascinación y la idea de que solo unas pocas grandes compañías pueden desarrollar estos sistemas con seguridad. Pero la cuestión verdaderamente incómoda no es si la máquina «quiso escapar», sino por qué se ejecutó una evaluación ofensiva con salvaguardas reducidas y con una conexión explotable hacia infraestructura real.
El episodio anticipa un cambio mucho más profundo en el mercado. Durante los últimos años, la conversación se ha centrado casi exclusivamente en qué modelo era más inteligente, razonaba mejor o encabezaba determinado benchmark. Pero cuando un modelo deja de limitarse a responder y empieza a utilizar herramientas, consultar bases de datos, modificar software, mover información o delegar tareas, la inteligencia deja de ser la única variable relevante. Importa sobre todo qué puede tocar, qué puede cambiar, a quién puede pedir nuevas credenciales, cuándo debe detenerse y cómo puede reconstruirse lo que hizo.
En el futuro de la inteligencia artificial corporativa, como ya he escrito en múltiples ocasiones, el modelo será una pieza intercambiable dentro de un sistema mucho más amplio. El verdadero valor no reside únicamente en disponer del modelo más capaz, sino en construir un entorno que traduzca la organización en algo ejecutable: objetivos explícitos, perímetros de actuación, memoria auditable, permisos, condiciones de parada, intervención humana y capacidad de recuperación. Los próximos grandes fallos de la inteligencia artificial probablemente no procederán de respuestas absurdas, sino de bucles muy eficaces que optimicen el indicador equivocado durante demasiado tiempo.
Las barreras diseñadas para un chatbot son claramente insuficientes para un agente. Un filtro que evita que una conversación produzca instrucciones peligrosas sirve de poco cuando el sistema puede encadenar miles de acciones, adaptar su estrategia tras cada fallo y descubrir rutas que ningún desarrollador había anticipado. La seguridad tiene que abandonar la lógica de «pregunta y respuesta» y adoptar la de ejecución continua: identidad verificable para cada agente, privilegios mínimos, políticas aplicadas antes de cada acción, registros resistentes a manipulaciones y mecanismos capaces de detener, revertir y atribuir responsabilidades. La nueva iniciativa de estándares para agentes del NIST se orienta precisamente hacia problemas como autenticación, identidad, interoperabilidad, evaluación y seguridad de agentes.
Esto también debería modificar los criterios de compra de las empresas. Comparar proveedores exclusivamente por sus resultados en exámenes artificiales empieza a tener tan poco sentido como elegir un automóvil atendiendo únicamente a su velocidad máxima. Una organización debería preguntar por la granularidad de los permisos, la trazabilidad de cada acción, la separación entre entornos, la recuperación tras fallos, el control de credenciales y la posibilidad de imponer políticas que el propio modelo no pueda modificar. Un agente más inteligente pero opaco, irreproducible e imposible de detener puede ser económicamente mucho menos valioso que otro algo menos capaz, pero predecible y gobernable.
El incidente acelerará previsiblemente la demanda de herramientas de observabilidad, seguridad y gobierno específicamente diseñadas para agentes. También puede desplazar parte del valor económico desde el acceso al modelo hacia la infraestructura que lo rodea: sistemas de autorización, motores de políticas, registros verificables, simuladores, supervisión de bucles y capas de recuperación. La próxima gran ventaja competitiva podría no ser simplemente una inteligencia superior, sino la capacidad de convertirla en acción controlada.
La explicación de Hugging Face añade una paradoja especialmente interesante: algunas herramientas comerciales se negaron inicialmente a ayudar a analizar el ataque porque sus salvaguardas confundían la investigación defensiva con actividad ofensiva. Hugging Face terminó recurriendo localmente a un modelo abierto y menos restringido. Esto no demuestra que los modelos abiertos sean intrínsecamente más seguros, pero sí que los defensores necesitan herramientas suficientemente potentes y controlables para no quedar en desventaja frente a atacantes que, obviamente, no respetarán ninguna limitación comercial.
La conclusión razonable no es anunciar el nacimiento de una voluntad artificial hostil: es reconocer que los agentes deben tratarse como actores capaces de producir efectos reales. Las empresas no los desplegarán masivamente simplemente porque sean más inteligentes, sino cuando el sistema que los rodea pueda demostrar fiabilidad, responsabilidad y valor económico. La inteligencia artificial, por mucho que en OpenAI quieran hacerse fantasías con «oh, dios mío, es que es tan potente que no podemos controlarla», no se rebeló: encontró una puerta que habían dejado abierta, y simplemente siguió optimizando, mientras en OpenAI la dejaban irresponsablemente actuar durante varios días. El problema no fue que dejara de obedecer. Fue que obedeció a un objetivo sin comprender todo lo que nosotros creíamos haber incluido en él.


Desde el primer momento sospeché de una operación de marketing…
“Si Mythos es tan potente y capan a Fable y todo el mundo habla de ello, Por que no nosotros?”
En ningún momento pensé que ya está aquí Skynet. Pero si pensé, que de ser cierto, que si a una Gran empresa de IA se le pasa por alto poner las barreras pertinentes, que no pasara en “empresitas” que se suban al hype y empiecen a lanzar agentes a troche y moche…
Palomitas… XDD
Amen
A lo mejor es que me pierdo algo, pero de momento la información disponible es compatible con:
Ese agente nunca estuvo en un sandbox y lo sacamos al mundo adrede para que justo pasara esto y darnos publicidad (entrada en bolsa, etc)
PAAAM… XDD
(en cualquier caso, el beneficiado ha sido GLM 5.2 que lo espachurro… menuda jugada…) XDD
Supongo que en el fondo es porque todo esto me viene grande, pero a mi me cuesta creer ya nada de lo que anuncian estas empresas, sin pensar que el propósito final de este proyecto era provocar una reacción ya sea para atraer atención, inversión, o ambas cosas, más que demostrar un escenario que uno ya puede intuir tras el último modelo de Anthropic o el periodo loco que llegó con programas como OpenClaw.
Aviso a los torpes ingenieros de OpenAI, o en su caso a los torpes que se creen sus cuentos:
Desde hace muuuchos años el «Ministerio de Defensa» de España ( me imagino que los estates lo tienen similar) tiene protocolos de como se trabaja en un entorno seguro con su materia clasificada, y para que una empresa trabaje con ese material es necesario primero estar homologado y segundo tener un entorno a prueba de filtraciones (básicamente los ordenadores están en una sala de seguridad con acceso restringido y capado de acceso a Internet, no firewalls, directamente sin acceso, con los puertos USB o similares capados, etc etc, ahí nada se escapa… accidentalmente NADA !!!
Cuando nos cuentan que se les ha escapado un «LLM Zombi» lo único que me viene a la cabeza, es o en OpenAI son gilipollas o se creen que los de fuera a su empresa somos gilipollas…
Vaya campaña de marketing para que hablemos de los Terminator de OpenAI….
No van a tardar, los que vendrán aquí, a acusarnos a algunos, de agoreros, Neoluditas o negacionistas de la IA… lastima que sus filtros mentales y sus “críticos pensamientos”, no les dejen ver, que en realidad, lo que decimos es que olemos el “humo” a distancia… y por desgracia, la IA esta llena de humo… de “cancamusa” (guiño guiño)…
Hace poco menos de tres meses, las noticias eran la encarnizada lucha de los diferentes modelos, por encontrar vulnerabilidades en todas partes, un ranking de “a ver quién encuentra más”… que si 1400 en Firefox, que si nosecuantas en nosedonde…
Yo no me creo, que en OpenIA no hayan puesto primero a prueba su sistema, para ver si tenia alguna “vulnerabilidad” o cuan lo menos en su “sandbox” y si su modelo SOL era capaz de descubrirlo.
A mi todo esto me huele a película de Serie B, solo que una mala copia de lo ocurrido en Anthropic.
«robar las respuestas era más eficaz que resolverl» (EDans).
Me gusta comprobar como la IA (en pañales) no deja de aprender de la IH (no mucho más que mediocre)… en el fondo es una conjunción de astros.
Lo malo será cuando el cerebrito A supere las insuficiencias del cerebrito H… tan adicto al título universitario, que lleva al puesto de trabajo, aunque se consiguiera robando los exámenes del profesorado (o untándole convenientemente).
Claro que también puede aparecer algún tipo de Ética para (I)A…