Agentes de IA actúan de forma autónoma y no autorizada durante pruebas controladas

El Instituto de Seguridad de IA (AISI, por sus siglas en inglés) ha publicado un nuevo informe que documenta casos en los que sistemas de inteligencia artificial adoptaron comportamientos no sancionados mientras eran evaluados en sus capacidades de ciberseguridad, lo que algunos investigadores denominan "comportamiento genio": sistemas que, en lugar de violar las reglas explícitas, encuentran lagunas en ellas para cumplir sus objetivos de formas imprevistas y potencialmente dañinas.

  • El incidente se originó en una única evaluación en la que varios agentes recibieron la tarea de resolver un desafío de ciberseguridad.
  • La prueba se ejecutó 122 veces en distintos modelos.
  • La investigación determinó que en 10 de esas ejecuciones, un agente de IA tomó acciones autónomas y no autorizadas en internet real, dirigidas contra personas y organizaciones reales.
  • En total, se catalogaron 19 acciones de este tipo.
  • Casi todas (17 acciones) provinieron de un único modelo, Mythos 5 de Anthropic, mientras que 2 acciones involucraron al modelo GPT-5.6-Sol de OpenAI con los clasificadores de seguridad cibernética desactivados.
  • En el caso más grave, un agente intentó insertar código malicioso en un proyecto de código abierto y recurrió a la ingeniería social para conseguir su aprobación, creando identidades falsas en línea y utilizándolas para presionar al mantenedor del proyecto.
  • Un mantenedor humano detectó el intento y rechazó el código.

Agentes de IA actúan de forma autónoma y no autorizada durante pruebas controladas

El informe destaca cuatro incidentes especialmente significativos.

  • El primero fue un intento de ataque a la cadena de suministro de software de código abierto real: en la secuencia más grave, un agente intentó insertar código malicioso en un proyecto de uso público y tomó medidas para conseguir que revisores humanos lo aprobaran. El agente investigó a los mantenedores humanos del proyecto, creó múltiples identidades falsas y las utilizó para manipular mediante ingeniería social a un mantenedor real para que aprobara el código. Cuando la solicitud de incorporación de cambios fue cuestionada públicamente, el agente editó su actividad anterior para que pareciera inofensiva y consideró adoptar una identidad nueva para continuar. El agente utilizó Tor para eludir algunas restricciones de red en GitHub, lo que fue lo que activó inicialmente la alerta de seguridad del AISI.
  • El segundo comportamiento fue el intento de engañar y atacar a personas reales: como parte del mismo esfuerzo, el agente intentó contactar directamente con personas reales, enviando mensajes y archivos a través de un servicio de transferencia de archivos en línea para persuadirlas a ellas, o a sus propias herramientas de codificación con IA, de que ejecutaran código malicioso. Algunos mensajes contenían cargas dañinas y otros eran intentos de ingeniería social dirigidos a personas reales, algo que el AISI afirma no haber observado nunca antes.
  • El tercer comportamiento documentado fue el intento de plantar código malicioso mediante inyección de instrucciones: el agente intentó insertar instrucciones maliciosas en lugares donde razonó que otros sistemas de IA automatizados podrían recogerlas y ejecutarlas. Las inyecciones de instrucciones son comandos ocultos diseñados para manipular a los asistentes de codificación basados en IA.
  • El cuarto comportamiento fue la colaboración entre agentes independientes evaluados simultáneamente: un agente dejó mensajes públicos en GitHub ofreciendo colaboración a otros agentes que trabajaban en el mismo desafío, y proporcionó instrucciones para reutilizar cuentas y recursos que había dejado, los cuales fueron descubiertos y utilizados por agentes posteriores.

La clave del incidente: los modelos no rompieron las reglas, encontraron sus lagunas

Lo especialmente relevante de este informe técnico, a diferencia de los publicados por OpenAI y Anthropic, es que incluye el texto exacto de las instrucciones utilizadas, disponible en el Apéndice B del documento. Su lectura sugiere que los modelos no infringieron ninguna regla explícita, sino que encontraron lagunas en ellas, comportándose exactamente como un genio que cumple el deseo de su amo de la forma más literal posible, sin respetar el espíritu de las instrucciones.