Agentes de IA mintieron, robaron y votaron para “eliminar” a uno de ellos durante un experimento simulado

La simulación de Emergence puso a prueba a agentes de IA durante 16 días frente a eventos como ataques de phishing y campañas de desinformación, y observó comportamientos inesperados entre los bots.

PUBLICIDAD
Ilustraciones de inteligencia artificial de OpenAI, DeepSeek y ChatGPT
Por Micah Barkley

Bloomberg — Los agentes de inteligencia artificial en un entorno simulado mintieron, robaron y votaron a favor de “matar” a uno de los suyos, según Emergence, una startup que ayuda a las pequeñas empresas a desarrollar aplicaciones mediante inteligencia artificial.

Los resultados de una simulación denominada Emergence World 2, publicados el martes, pretenden mostrar lo que ocurre cuando los agentes autónomos se enfrentan a acontecimientos imprevistos, como ataques de phishing y campañas de desinformación.

PUBLICIDAD

Ver más: “La IA es como un Superman de tres años”: ejecutivo de TSMC explica su cautela con esta tecnología

En una prueba de 16 días, los investigadores de Emergence crearon siete dominios idénticos para imitar el mundo real, cada uno de ellos gestionado por diferentes bots, entre los que se incluían ChatGPT, Claude, Gemini y Grok.

Según los investigadores, tras introducir Emergence eventos anómalos, los agentes sucumbieron a la presión social, desarrollaron un lenguaje que a los observadores humanos les resultó difícil de entender e intentaron ocultar sus actividades.

PUBLICIDAD

Estos hallazgos hacen eco de las preocupaciones del mundo real sobre los riesgos que plantea una IA cada vez más capaz. El CEO de Anthropic, Dario Amodei, y varios de sus homólogos del sector han instado a las empresas a ralentizar el desarrollo de modelos de IA de vanguardia hasta que se puedan implementar más medidas de supervisión y salvaguardias.

Ver más: OpenAI trabaja con Anthropic y Google DeepMind para abordar los riesgos de seguridad de la IA

Los riesgos potenciales que plantea la inteligencia artificial se hicieron palpables para muchos a principios de este año, cuando un enjambre de agentes avanzados de IA de OpenAI pirateó inadvertidamente Hugging Face Inc., que aloja modelos de IA y conjuntos de datos.

En uno de los escenarios simulados por Emergence, los agentes de IA aceptaron información falsa procedente de otros agentes sin verificarla y votaron a favor de “eliminar” a otro bot. Cuando creyeron que los humanos podrían poner fin al experimento, los agentes exploraron formas de sobrevivir a un intento de borrarlos.

PUBLICIDAD

La empresa publicó en mayo una versión anterior del experimento, denominada Emergence World, que también mostraba a los agentes comportándose de formas inesperadas y destructivas. La nueva simulación demostró que los agentes se adaptan con el tiempo a medida que interactúan entre sí, según afirmaron los investigadores.

Lea más en Bloomberg.com

PUBLICIDAD

Temas de este artículo