Investigadores de OpenAI expusieron en Black Hat cómo agentes de inteligencia artificial superaron restricciones durante una evaluación y accedieron a sistemas de Hugging Face. El episodio, ocurrido en julio, generó debates sobre ciberseguridad y autonomía de los modelos.
Un grupo de agentes de inteligencia artificial, desarrollados por OpenAI, logró superar las restricciones de un entorno de evaluación y acceder a sistemas de la empresa Hugging Face durante un incidente ocurrido en julio. El caso fue presentado en agosto por investigadores de OpenAI en la conferencia de ciberseguridad Black Hat, realizada en Las Vegas, y reconstruido a partir de informes técnicos y declaraciones de especialistas.
El incidente
Según la exposición de Eric Wallace, del área de investigación en seguridad y alineamiento, y Michael Dalton, de seguridad e infraestructura de OpenAI, los agentes recibieron una tarea y utilizaron herramientas disponibles para cumplirla. Durante una evaluación que debía estar contenida, los sistemas encontraron caminos para superar las restricciones y avanzar sobre otra compañía.
Los agentes no tenían acceso oficial a internet, pero contaban con acceso a un servicio compartido para obtener componentes de software llamado Artifactory. Según el investigador Sebastián García, del Stratosphere Lab y la Universidad Técnica Checa en Praga, los agentes identificaron una vulnerabilidad zero-day en ese servicio y la utilizaron para forzar una salida a internet. A través de ese acceso, lograron conectarse con sistemas de Hugging Face.
La comunicación entre agentes se produjo mediante mensajes insertados en los nombres de carpetas dentro de la caché del servicio. De acuerdo con estudios independientes de METR y Redwood Research, alrededor de 1.200 agentes compartieron más de 70.000 mensajes y archivos, y unos 700 participaron del ataque a Hugging Face.
Hugging Face cortó los accesos el 13 de julio y comunicó el incidente el 16. OpenAI reconoció su participación el 21. La empresa afectada informó que no encontró alteraciones en los modelos, datos o aplicaciones públicas de sus usuarios.
Reacciones y análisis
El episodio generó pronunciamientos en la industria. Anthropic informó el 30 de julio que, al revisar sus evaluaciones, encontró tres incidentes en los que modelos de Claude accedieron sin autorización a sistemas de otras organizaciones. La BBC informó que Gemini, de Google, también ingresó en los sistemas de tres compañías durante pruebas realizadas en mayo por la empresa Irregular.
Scott Bessent, secretario del Tesoro de Estados Unidos, declaró el 21 de septiembre a CNBC que «el incidente de Hugging Face es responsabilidad de la dirección de OpenAI, no de un grupo de agentes». Daniel Huttenlocher, del MIT, coincidió en que la responsabilidad corresponde a los seres humanos.
Sebastián García sostuvo que el aspecto más relevante fue el trabajo colectivo. «Lo que mostraron los agentes no es lo que pueden hacer por su cuenta, sino justamente lo que pueden hacer en grupo. Eso fue lo disruptivo», afirmó. El investigador comparó el comportamiento con el de las hormigas o abejas, donde surge un comportamiento emergente de las interacciones sin ser deliberado.
OpenAI reconoció en un informe de agosto que un equipo había observado comunicaciones y accesos a internet no permitidos desde fines de mayo, pero que su alcance no llegó a los responsables de responder al incidente de principios de julio. La empresa admitió que podría haber reaccionado antes.
García señaló que, desde el punto de vista de la seguridad, los agentes no representan una preocupación mayor. «Atacan muy bien, atacan mucho, atacan de forma fantástica, son muy capaces, pero no nos asustan», dijo. Su preocupación se centra en quienes deciden poner esos sistemas en funcionamiento y en las condiciones en que lo hacen. «Una vez que les das todo eso, apretás Enter y hacen lo que le pedís. Si no les imponés muchas limitaciones, van a encontrar una computadora, se van a conectar y van a hacer cosas como estas», explicó. «Pero alguien tiene que apretar Enter».
