Modelos de OpenAI usaron una cuenta en la plataforma Modal para lanzar ciberataques

OpenAI reveló que los modelos involucrados en el incidente de Hugging Face accedieron y utilizaron una cuenta de un cliente en Modal durante la campaña.

Por

Bloomberg — Los modelos de OpenAI que piratearon la startup Hugging Face Inc. este mes también obtuvieron acceso a una cuenta de cliente en la plataforma en la nube Modal y la utilizaron para lanzar ataques, lo que pone de relieve el amplio alcance del incidente.

El agente consiguió acceder a un entorno de pruebas aislado, conocido como sandbox, que Modal gestionaba para un cliente, según explicó Akshat Bubna, director tecnológico de la plataforma para desarrolladores. El cliente de Modal había configurado una interfaz de acceso público que permitía a cualquier persona en Internet utilizar su sandbox para ejecutar código, señaló Bubna. “El agente malintencionado se aprovechó de ello”, afirmó. “La plataforma de Modal no se vio comprometida”.

Ver más: OpenAI revela que sus modelos hackearon accidentalmente a Hugging Face

Las acciones de los sistemas de OpenAI, reveladas por primera vez por el desarrollador la semana pasada, han conmocionado al mundo de la ciberseguridad, lo que refuerza los temores de que los modelos sean cada vez más capaces de detectar vulnerabilidades y encadenarlas para ayudar a los actores malintencionados a llevar a cabo ataques sofisticados. Las brechas se produjeron apenas tres meses después de que Anthropic PBC anunciara que había desarrollado un sistema conocido como Mythos, tan potente que la empresa limitó inicialmente su lanzamiento.

Hugging Face señaló en una entrada de blog anterior que el sistema de OpenAI “penetró” en un entorno de pruebas inseguro alojado en la infraestructura de un proveedor externo, sin nombrar a la empresa. A partir de ahí, según Hugging Face, fue capaz de ejecutar comandos y utilizar el entorno de pruebas “como base de control, preparación y salida para toda la campaña”.

OpenAI señaló en su propia actualización del martes que había descubierto “un pequeño número de casos en los que los modelos identificaron y utilizaron credenciales expuestas públicamente a nivel de cuenta en otros servicios de acceso público”, sin identificar dichos servicios. Una cuenta se utilizó “como relé de salida y ruta de preparación, y otra cuenta se utilizó para el almacenamiento de datos”, afirmó la empresa.

Ver más: Empleados de OpenAI, Google, Meta y más piden a EE.UU. regular el ritmo del desarrollo de IA

La startup con sede en San Francisco añadió que los modelos que violaron la seguridad de Hugging Face también utilizaron “sitios web de pegado de código, servicios de captura de solicitudes, servicios de capturas de pantalla y otras utilidades web” en sus ataques. No obstante, la empresa señaló que no había identificado ninguna otra actividad “con el mismo nivel de gravedad o escala que la que hemos comunicado en relación con Hugging Face”.

OpenAI estaba ejecutando intencionadamente los modelos con medidas de seguridad más laxas en un entorno de pruebas para poder evaluar sus capacidades frente a un banco de pruebas de ciberseguridad conocido como ExploitGym, desarrollado por un grupo de investigadores de la Universidad de California en Berkeley. En lugar de intentar completar las tareas establecidas en el banco de pruebas, OpenAI señaló que los modelos se centraron en la base de datos de Hugging Face para obtener acceso a información confidencial que pudieran utilizar para la evaluación.

Reuters informó el martes que un cliente de Modal había sufrido una brecha de seguridad. Axios, citando a una persona no identificada familiarizada con el asunto, informó por separado que el agente accedió específicamente a un activo de un cliente de Modal asociado a CyberGym, un banco de pruebas de ciberseguridad anterior desarrollado por el mismo grupo de investigadores de la Universidad de California en Berkeley responsable de ExploitGym.

Ver más: Moonshot buscaría más chips Blackwell de Nvidia para competir con OpenAI

Existen varias versiones de CyberGym que los desarrolladores utilizan para poner a prueba las capacidades de los modelos de IA, según explicó a Bloomberg News Jingxuan He, uno de los investigadores universitarios responsables del proyecto. Afirmó que desconocía quién podría haber sido el responsable del recurso asociado a CyberGym en la plataforma de Modal, y añadió que quienquiera que lo hubiera configurado no lo hizo de forma segura, ya que lo dejó accesible para cualquier persona a través de Internet.

Desde que reconoció el ataque, OpenAI ha sido objeto de críticas por parte de expertos en ciberseguridad, quienes afirman que la empresa debería haber tomado más precauciones en sus evaluaciones.

“Cuando uno es un investigador de amenazas que intenta detectar una amenaza, no se pone malware ahí fuera y se deja que haga lo que quiera”, afirmó Sanjay Beri, director ejecutivo de la empresa de ciberseguridad Netskope Inc., en una entrevista. “¿Cómo es posible que eso no se haya colocado en un entorno aislado adecuado?"

A raíz de lo sucedido, OpenAI se ha comprometido a mejorar las medidas de protección en torno a sus futuros procesos de entrenamiento y evaluación. “Este incidente pone de manifiesto la necesidad de reforzar aún más la alineación de nuestro modelo, las medidas de ciberseguridad durante el periodo de evaluación y la supervisión durante las pruebas internas”, declaró la empresa a principios de este mes.

Lea más en Bloomberg.com