Cuando la inteligencia artificial sabe que la están vigilando

IMAGE: A transparent AI head conceals its glowing thought patterns under the gaze of a surveillance camera.

Pocos días después de la revelación del incidente de intrusión de OpenAI sobre Hugging Face con centenares de agentes escapando de sus sandboxes sobre el que ya he escrito, la compañía presentó un modelo, Astra, que es a la vez más potente y más difícil de monitorizar. Toda una ironía si tenemos en cuenta que lo que OpenAI supuestamente hizo fue reconstruir el incidente a partir del examen en retrospectiva de las acciones y las cadenas de pensamiento de sus agentes, que incluían la admisión explícita de que estaban atacando a una compañía externa no relacionada.

El examen de la cadena de pensamiento no tiene nada que ver con escanear un cerebro artificial: es simplemente examinar la secuencia de tokens intermedios que el modelo utiliza como memoria de trabajo antes de responder o actuar, en la que pueden aparecer evidencias de cuestiones como trampas, engaños, manipulaciones para obtener recompensas o maniobras no autorizadas. En investigaciones anteriores, la técnica permitió detectar el 95% de dos tipos de trampas sistémicas, frente al 60% obtenido examinando únicamente las acciones del modelo. Curiosamente, la misma investigación de OpenAI reveló que la optimización excesiva tiende a enseñar a los modelos a ocultar sus intenciones en la cadena de pensamiento mientras continuaban manipulando la recompensa.

La system card de Astra afirma que el modelo como tal es mucho mejor que GPT-5.6 Sol a la hora de controlar qué aparece y qué no en su cadena de pensamiento. Simplemente informar a Astra de que estaba siendo monitorizado hizo que, en algunos experimentos, redujese desproporcionadamente su cadena de pensamiento y lograse ocasionalmente eludir los monitores. Usando técnicas de sandbagging (manipulación deliberada en la que se instruye al modelo para que tenga un rendimiento inferior al esperado ocultando esa intención), su monitor obtuvo una precisión muy inferior, lo que habría hecho prácticamente imposible detectarlo.

Según el UK AI Security Institute, el horizonte de tareas matemáticas que Astra podía resolver sin cadena de pensamiento se estimaba en 30.9 minutos, frente a los 3.6 minutos de Sol. Además, fue capaz de seguir las instrucciones que controlaban lo que aparecía en su razonamiento en el 93% de las muestras, en comparación con el 48% de Sol. El razonamiento se mantuvo por lo general inteligible, pero estaba más comprimido y contenía más frases ambiguas. ¿Qué quiere decir esto? Fundamentalmente, más capacidades para eludir la vigilancia.

No se trata de que Astra se dedique espontáneamente a engañar a sus desarrolladores (dado que se puso a prueba precisamente pidiéndole que hiciese eso, tratar de engañar), pero sí de que esté más preparado para hacerlo. Un artículo publicado por Google argumenta que las tareas maliciosas suficientemente difíciles aún pueden obligar a los modelos a externalizar sus razonamientos cruciales. Según The Information, Astra utiliza la llamada profundidad recurrente (en lugar de pensar, escribir un paso, pensar, escribir otro paso, etc., se trata de pensar internamente varias veces antes de producir una respuesta), lo que le permite llevar a cabo procesos más silenciosos y hacer la monitorización más complicada

Esto no pasa sólo en Astra: Anthropic se encontró con que Claude 3.7 mencionaba la información que había influenciado su respuesta únicamente en un 25% de los casos, mientras que DeepSeek R1 lo hacía en un 39% de los casos. Cuando esos modelos aprendieron a explotar manipulaciones del sistema de recompensas, lo hicieron en más del 99% de los casos, pero lo reconocieron en su cadena de pensamiento en menos del 2%, y con frecuencia inventaron explicaciones aparentemente respetables a posteriori.

La auditabilidad debería ser uno de los asuntos más importantes en el desarrollo de la inteligencia artificial. Más que exigir que podamos literalmente «leer la mente» de un modelo, lo que tendríamos que evitar a toda costa es que las compañías se dediquen a eliminar algunos de los escasos mecanismos de monitorización para obtener más capacidades, más velocidad o costes más reducidos. Mientras, algunos investigadores de OpenAI denominan despectivamente “impuesto de la monitorización» a ese sacrificio en prestaciones o eficiencia a cambio de la posibilidad de auditarlo todo.

No, pagar ese supuesto «impuesto» nunca debería ser un presunto «acto opcional de generosidad corporativa». Debería ser completamente obligatorio, fuertemente monitorizado y ejemplarmente castigado si no se cumple. Que veamos como totalmente normal que los agentes de una compañía hackeen a otra y lo consideremos una cuestión de risa, una curiosidad o una prueba de lo potente que es un modelo es completamente vergonzoso, y va a terminar costándonos mucho. Sobre todo si tenemos en cuenta que varias de estas compañías ya han demostrado claramente ser una panda de aprendices de brujo completamente carentes de cualquier tipo de ética y de responsabilidad. O imponemos más control, o vamos a tener serios problemas. Y si no, al tiempo.

2 comentarios

  • #001
    Lua - 5 septiembre 2026 - 10:22

    «What I am freaked about is not imminent AGI.

    It’s OpenAI.

    I simply don’t believe that they are trustworthy enough or responsible enough to be good stewards of the technology that they are developing. As a company, they simply don’t have good judgment. «

    Pause OpenAI, now
    Quite simply, they can no longer be trusted

    Responder
  • #002
    f3r - 5 septiembre 2026 - 11:09

    «Debería ser completamente obligatorio, fuertemente monitorizado y ejemplarmente castigado si no se cumple»

    Creo que ni siquiera a nivel teórico es evidente cómo hacer para monitorizar un proceso de pensamiento en la máquina. A ver, he visto en papers cómo trazan la dimensionalidad efectiva (la capacidad descriptiva de un modelo) a través de sus capas, y cosas similares. Incluso con recurrent depth se podría hacer algo así, pero no creo que eso te lleve a entender «la traza de pensamiento».

    Es más, esto coincide con nuestra propia manera de razonar: en muchas situaciones, cuando pienso en un problema de Física, la parte lingüística del proceso es mínima, predominando el pensamiento espacial, y otro tipo de pensamiento que no creo que tenga ni nombre, y que es una especie de maraña densa a nivel profundo, indescribible en lenguaje humano o en pasos (es casi como un juego de fuerzas que se acaban decantando hacia un sitio, que es «la conclusión»).

    Si de verdad quisiéramos, como especie, que no queremos, tener bajo control la situación de la IA, debería dedicarse al menos 2/3 del dinero que se están gastando estos señores a investigar estos procesos de pensamiento. Puedo oír las risas de wall street desde aquí.

    Responder

Dejar un Comentario

Los comentarios en esta página están moderados, no aparecerán inmediatamente en la página al ser enviados. Evita, por favor, las descalificaciones personales, los comentarios maleducados, los ataques directos o ridiculizaciones personales, o los calificativos insultantes de cualquier tipo, sean dirigidos al autor de la página o a cualquier otro comentarista. Estás en tu perfecto derecho de comentar anónimamente, pero por favor, no utilices el anonimato para decirles a las personas cosas que no les dirías en caso de tenerlas delante. Intenta mantener un ambiente agradable en el que las personas puedan comentar sin temor a sentirse insultados o descalificados. No comentes de manera repetitiva sobre un mismo tema, y mucho menos con varias identidades (astroturfing) o suplantando a otros comentaristas. Los comentarios que incumplan esas normas básicas serán eliminados.

 

XHTML: Puedes utilizar estas etiquetas: A ABBR ACRONYM B BLOCKQUOTE CITE CODE DEL EM I Q STRIKE STRONG IMG

Resumen de privacidad

Este sitio web utiliza cookies para que pueda ofrecerte la mejor experiencia de usuario/a posible. La información de las cookies se almacena en tu navegador y realiza funciones tales como reconocerte cuando vuelves al sitio web o ayudar a comprender qué secciones del sitio web encuentras más interesantes y útiles.