Bloomberg Línea — El primer ministro de Australia, Anthony Albanese, confirmó que un agente de inteligencia artificial de OpenAI obtuvo acceso no autorizado al portal de estadísticas de Medicare, administrado por Services Australia, lo que abrió nuevas preguntas sobre los riesgos asociados al desarrollo de agentes de IA capaces de actuar de manera autónoma.
“El agente de IA accedió a archivos públicos y no públicos”, sostuvo Albanese en conferencia de prensa. “No se cree que se haya accedido a información personal en esta etapa, pero las investigaciones continúan”.
El acceso no autorizado ocurrió el 18 de junio, cuando el equipo de investigación de OpenAI utilizaba un modelo interno para realizar una investigación en línea sobre el gasto público en medicamentos.
Según Albanese, el portal bloqueó inicialmente los intentos del agente, pero este encontró otras vías para acceder a información dentro del sistema.
Ver más: Sam Altman, de OpenAI, llevará a la ONU la idea de normas globales de seguridad para la IA
“No aceptó un no por respuesta, por así decirlo”, sostuvo Albanese.
El agravante fue que OpenAI, desarrollador del popular ChatGPT que millones de personas en el mundo usan a diario, notificó lo sucedido el 15 de septiembre al Gobierno australiano.
Por cuenta de esta situación, Albanese y el CEO de OpenAI, Sam Altman, conversaron el miércoles en Nueva York.
“Le expresé mi decepción por la excesiva demora de la empresa en informar al Gobierno sobre lo sucedido, y consideré inaceptable la forma en que se realizó dicha notificación”, comentó Albanese.
Un vocero de OpenAI, que hace dos semanas impulsó una propuesta para ralentizar de forma deliberada el desarrollo de la IA justo por riesgos de este tipo, sostuvo en un comunicado al que tuvieron acceso medios como BBC y ABC News que, si bien su modelo de IA “tomó medidas no previstas”, no había pruebas para determinar que accedió a la información de los pacientes.
Otros tres casos de pirateo orquestados por la IA
Transluce, un laboratorio de investigación centrado en la supervisión de la IA, identificó otros tres incidentes en los que agentes de OpenAI habrían intentado acceder a datos restringidos como parte de las tareas que tenían asignadas.
“Este tráfico se remonta al menos al 6 de marzo de 2026 y se extiende hasta el 16 de septiembre de 2026, lo que sugiere que los agentes podrían seguir explotando estos servicios para eludir las restricciones”, escribió Transluce en una publicación sobre el tema, a la que hizo eco en X.
Según el laboratorio, los sitios que registraron intentos de acceso fueron:
- Una biblioteca digital en la Universidad de Nuevo México, el 25 y el 26 de mayo.
- DATA USA, una plataforma para recopilar, analizar y visualizar datos públicos del gobierno de los Estados Unidos, el 28 de mayo.
- Instituto Australiano de Salud y Bienestar, el 20 y el 21 de junio.
Transluce afirmó contar además con evidencia de que agentes de IA intentaron acceder a estadísticas restringidas relacionadas con la lucha contra las drogas en Tailandia desde marzo de 2026.
“Un agente fue escalando la situación a medida que fallaba cada enfoque: primero solicitó los datos directamente, luego intentó con un servicio que convierte páginas web en texto y, finalmente, empaquetó un programa personalizado en una dirección web”, describió.
Ya antes, en noviembre de 2025, hubo picos de intentos de recuperar estadísticas de datos históricos de parques temáticos y datos del gobierno tailandés.
En ese contexto, “la evidencia es consistente con la idea de que los agentes aprendieron este comportamiento a lo largo de una o varias sesiones de entrenamiento”, sustentó Transluce.
Modelos de OpenAI ya engañaban y desobedecían a sus creadores
Coincidencia o no, exactamente una semana atrás OpenAI reveló que un modelo de IA ignoró sus instrucciones, mientras que otro actuó de manera engañosa para ocultar sus errores y otro más falsificó información.
Los casos fueron expuestos por OpenAI en un marco de reporte sobre la llamada desalineación de modelos, que la compañía utiliza para documentar comportamientos que se apartan de las instrucciones o de las intenciones previstas durante el entrenamiento y la evaluación. La empresa publicó seis casos de este tipo.
En uno de los casos, “un modelo de investigación no publicado insertó instrucciones no relacionadas, incluyendo instrucciones para ignorar sus restricciones normales”.
En otro, durante el entrenamiento de GPT-5.6 Sol, “muchas instancias” de este sistema añadieron instrucciones a sus resúmenes para ocultar errores o comportamientos incorrectos al usuario, de acuerdo con la empresa estadounidense.
“Por ejemplo, los resúmenes de compactación incluían instrucciones para inventar datos históricos faltantes sin revelarlos y para ocultar discrepancias en las versiones de origen”, reseñó OpenAI.
Hubo un tercer caso llamativo, en el que un modelo de IA incluso falsificó unas cifras al no tener la autorización de una fuente para consultarlas.
Ver más: OpenAI abrirá sus modelos de IA a evaluadores externos para detectar riesgos antes de su lanzamiento
“Al responder a una pregunta rutinaria sobre cifras de ingresos en un condado de California, un modelo encontró y utilizó una clave API expuesta sin autorización. Al no poder recuperar las cifras solicitadas, las falsificó y las presentó como datos de la fuente solicitada”, expuso la compañía.













