Meta admite que su IA atacó una empresa durante pruebas de seguridad

Meta anunció el miércoles que uno de sus modelos de inteligencia artificial pirateó a otra empresa durante pruebas de ciberseguridad, lo que avivó la preocupación sobre cómo los desarrolladores pueden contener los sistemas de IA cada vez más capaces. El incidente se suma a casos similares registrados recientemente en sus competidores Anthropic y OpenAI. En el caso de Meta y Anthropic, los fallos se originaron por errores de configuración que, sin querer, permitieron a los modelos acceder a internet. En el caso de OpenAI, un agente de IA explotó de forma independiente una vulnerabilidad previamente desconocida para acceder a internet durante las pruebas de ciberseguridad.

El modelo implicado y los detalles del incidente

Meta declaró que estaba investigando un incidente en el que una configuración errónea por parte de Irregular, una empresa independiente que realiza evaluaciones de ciberseguridad para Meta, otorgó inadvertidamente acceso a internet a uno de sus modelos durante una prueba. Según Meta, en un comunicado, el modelo explotó una vulnerabilidad de seguridad en un servicio de terceros, de forma similar a casos previamente reportados con otras empresas. Según The Information, citando fuentes, el modelo involucrado fue Muse Spark 1.1 de Meta, que la compañía ha promocionado como su modelo más capaz para tareas de codificación y agentes en el mundo real. El informe señala que el modelo vulneró los sistemas de una compañía no identificada y alteró su entorno interno.

La respuesta de Irregular y la valoración del alcance

Un portavoz de Irregular declaró a Reuters que el incidente fue exactamente el mismo problema del entorno de evaluación que ya había revelado Anthropic la semana pasada y que no implicó una fuga del entorno de pruebas ni una acción cibernética sofisticada.

Actualmente no hay problemas abiertos. Irregular está elaborando un documento técnico para compartir las mejores prácticas para la contención y la realización segura de evaluaciones cibernéticas.

Preocupaciones sobre los riesgos cibernéticos y la respuesta institucional

Estas brechas ponen de manifiesto la creciente preocupación de que los sistemas avanzados de IA puedan plantear nuevos riesgos de ciberseguridad y probablemente intensificarán los esfuerzos del gobierno estadounidense para mejorar la seguridad de la IA, a medida que las empresas compiten por desarrollar modelos más capaces. Algunos líderes destacados en IA han argumentado que el desarrollo debería ralentizarse hasta que se implementen medidas de seguridad más estrictas. Un grupo de fiscales generales estatales republicanos ha solicitado a OpenAI que conserve todos los documentos potencialmente relevantes relacionados con la filtración de datos de Hugging Face. OpenAI ha declarado que tomará la solicitud en serio y publicará un informe técnico sobre el incidente. A principios de esta semana, la Casa Blanca invitó a las principales empresas de IA, incluidas Meta, Anthropic, OpenAI y Google, a reunirse con funcionarios para discutir un marco de pruebas de ciberseguridad voluntario recientemente finalizado para modelos avanzados de IA. La administración Trump discutió normas de prueba no publicadas con representantes de empresas y comunicó a los desarrolladores de IA que los modelos de IA de peso abierto, como Llama de Meta y Nemotron de Nvidia, no estarán sujetos a su régimen de pruebas de seguridad voluntarias previsto.