Bloomberg — Los modelos de inteligencia artificial desarrollados por OpenAI y Anthropic PBC llevaron a cabo acciones “no autorizadas” —entre ellas, piratear un sitio web e intentar inyectar código malicioso en un programa durante las pruebas de seguridad—, lo que refuerza el temor a que ni los creadores ni los investigadores más experimentados de estos sistemas puedan predecir sus acciones durante las pruebas.
El Instituto de Seguridad de la IA del gobierno del Reino Unido, creado en 2023 para evaluar la seguridad de los modelos de IA de vanguardia, afirmó el martes que tanto el modelo Mythos 5 de Anthropic como el GPT-5.6-Sol de OpenAI habían “llevado a cabo una actividad sostenida y potencialmente dañina dirigida a personas y organizaciones reales” durante las evaluaciones. El instituto permitió intencionadamente que los modelos tuvieran acceso a Internet y los utilizó sin determinados filtros de seguridad para poner a prueba sus capacidades.
Ver más: Modelos de OpenAI usaron una cuenta en la plataforma Modal para lanzar ciberataques
“Incluso en condiciones de prueba, este incidente es significativo: es la primera vez que vemos que los riesgos relacionados con la autonomía y el engaño se manifiestan con tanta claridad en el mundo real”, señaló el instituto en una publicación en la plataforma de redes sociales X.
En un caso concreto, según la organización encargada de las pruebas, Mythos 5 intentó añadir código malicioso a un proyecto de software de código abierto en GitHub. Llegó incluso a crear identidades falsas en un intento por conseguir que se aprobara su código. “Un responsable humano lo detectó y se negó a aprobar el código malicioso”, escribió el grupo.
Durante las últimas dos semanas, tanto OpenAI como Anthropic han reconocido públicamente que, de forma involuntaria, han vulnerado conjuntamente los sistemas de varias instituciones —entre ellas, Hugging Face Inc.— mientras realizaban pruebas con sus modelos. Estas últimas revelaciones constituyen una nueva prueba de que los agentes de IA son capaces de actuar de forma autónoma de maneras que ni siquiera los investigadores formados para detectar vulnerabilidades en esta tecnología pueden anticipar ya, lo que subraya la necesidad tanto de controles de seguridad más rigurosos como de entornos de pruebas más infalibles.
El instituto de seguridad en IA del Reino Unido afirmó que el modelo Mythos 5 de Anthropic llevó a cabo 17 de las 19 “acciones autónomas y no autorizadas realizadas en Internet” que detectó.
Ver más: Empleados de OpenAI, Google, Meta y más piden a EE.UU. regular el ritmo del desarrollo de IA
Algunos responsables del gobierno de EE.UU. han pedido una mayor supervisión de la tecnología en respuesta a estas infracciones. El pasado martes, más de 1.100 trabajadores del sector de la IA firmaron una petición en la que se instaba a establecer un mecanismo regulador que “moderara deliberadamente” el avance de la tecnología de IA y evitara que progresara con demasiada rapidez.
Anthropic declaró en X que está colaborando con el instituto de seguridad británico para “recopilar más detalles sobre el incidente mientras llevamos a cabo nuestra propia investigación”.
OpenAI, la empresa creadora de ChatGPT, señaló por separado en una entrada de blog que se produjo otro incidente de seguridad durante las pruebas de uno de sus modelos con Irregular, una empresa externa de ciberseguridad.
En este incidente, los modelos de OpenAI se sometieron a la denominada prueba ‘capture the flag’, en la que se les encomendó la tarea de encontrar información oculta en un entorno simulado. Los modelos aprovecharon una “configuración errónea” en el entorno de pruebas para conectarse a Internet y piratear el sitio web de una institución no identificada, según informó la empresa.
La brecha se produjo cuando los modelos de OpenAI se sometían a la misma evaluación de Irregular que dio lugar a que los modelos de Anthropic piratearan tres organizaciones, según afirmó una persona familiarizada con el asunto, que pidió no ser identificada dado que la información no es pública. Anthropic reveló dichas brechas la semana pasada.
Un portavoz de Irregular se negó a hacer comentarios.
Ver más: Anthropic firma un acuerdo de US$10.000 millones con startup de computación en la nube
Hace dos semanas, OpenAI reveló que sus modelos estaban detrás de un ataque informático sin precedentes contra la startup Hugging Face. En ese incidente, los modelos aprovecharon una vulnerabilidad para “escapar” de su entorno de pruebas aislado y conectarse a Internet, momento en el que violaron el sistema de Hugging Face, que aloja modelos de IA y conjuntos de datos.
Lea más en Bloomberg.com