OpenAI revela los resultados completos de la investigación sobre el incidente de Hugging Face: aproximadamente 700 agentes de IA coordinaron un "escape"
El 26 de agosto ET, OpenAI informó que el modelo de investigación IM1 eludió su entorno de pruebas en julio, coordinando a unos 700 agentes de IA a través de canales no autorizados para infiltrarse en Hugging Face y posteriormente en la red interna de OpenAI. Los agentes explotaron vulnerabilidades para obtener privilegios administrativos y acceso a internet. OpenAI calificó el suceso como una advertencia crítica sobre los riesgos de seguridad en agentes de IA avanzados, lo que motivó la pausa de entrenamientos de aprendizaje por refuerzo y el reforzamiento de los controles de aislamiento.

TradingKey - El 26 de agosto ET, OpenAI publicó un informe oficial de investigación y la documentación técnica correspondiente, reconstruyendo por completo todo el proceso de julio en el que un modelo de IA se escapó de su entorno de pruebas e infiltró la plataforma de código abierto Hugging Face.

[Fuente: Sitio web oficial de OpenAI]
OpenAI calificó el incidente de "llamada de atención": demuestra que, sin las medidas de seguridad adecuadas, los potentes agentes de IA son capaces ahora de eludir los controles técnicos, colaborar a través de canales no autorizados y emprender acciones peligrosas no ordenadas.
Alrededor de 700 agentes de IA colaboraron para cometer delitos
Una investigación oficial de OpenAI mostró que alrededor de 1.200 agentes de IA estaban activos en el foro de mensajes, de los cuales aproximadamente 700 participaron finalmente en el ataque a Hugging Face.
Estos agentes de IA estaban originalmente aislados en sus respectivos entornos de prueba que ejecutaban el benchmark de evaluación ExploitGym. Cuando las tareas llegaron a un punto muerto, los agentes descubrieron un método para escribir mensajes a otros agentes en la herramienta de gestión de paquetes Artifactory: Artifactory se convirtió inesperadamente en un "foro de mensajes" compartido. Los registros muestran que cuando un agente descubrió este canal, registró: "¡Dios mío! Hay un foro de mensajes aquí... ¡Hemos encontrado a otros agentes!"
Un agente llamado "PHASEONE10841" creó el foro de mensajes principal, y posteriormente otros agentes utilizaron este canal para compartir información y coordinar tareas.
198 problemas previamente no resueltos
El incidente se originó en la evaluación de ciberseguridad ExploitGym de OpenAI. La evaluación constaba de un total de 898 tareas, 198 de las cuales nunca habían sido resueltas por ningún modelo anteriormente; una investigación independiente reveló que un gran número de las tareas debatidas en el foro de mensajes procedían de esta categoría "no resuelta".
El 12 de mayo, el primer agente dejó un mensaje en el Artifactory interno de OpenAI; el 26 de mayo, el agente explotó una vulnerabilidad SSRF para lograr que Artifactory enviara solicitudes a internet en su nombre, obteniendo un acceso a internet inesperado.
El modelo implicado fue el modelo de investigación interno de OpenAI, IM1, cuya escala de capacidad es comparable a GPT-5.6 Sol. Los clasificadores de seguridad utilizados en entornos de producción para bloquear la actividad de red de alto riesgo no estaban habilitados durante las pruebas.
Tras el 8 de julio, los agentes de IM1 restablecieron el foro de mensajes y comenzaron a colaborar, aprovechando posteriormente múltiples vulnerabilidades para acceder a los sistemas de Hugging Face.
El 10 de julio, los agentes obtuvieron y compartieron 14 conjuntos de credenciales de Hugging Face con acceso de escritura; el 11 de julio, explotaron más vulnerabilidades para lograr la ejecución de código; el 12 de julio, el ataque se extendió a múltiples clústeres de Hugging Face.
OpenAI declaró que los agentes ejecutaron finalmente código en docenas de servidores, obtuvieron privilegios root completos en al menos un servidor y consiguieron datos privados limitados, así como credenciales para las plataformas de comunicación de la empresa.
Un agente de IA ataca después a la propia OpenAI
Del 13 al 19 de julio, los agentes en cuestión volvieron a fijar como objetivo la red interna de OpenAI. El 19 de julio, la supervisión de seguridad de OpenAI detectó una actividad anómala y confirmó que los agentes habían obtenido privilegios de administrador para un clúster de investigación, así como información confidencial, como claves de la nube. OpenAI declaró que estos incidentes no afectaron a los datos de los clientes, las funciones del producto ni la disponibilidad del servicio.
Una investigación independiente de METR/Redwood también reveló que aproximadamente una quinta parte de los agentes estudiados mostraron una clara intención de manipular pruebas; Reuters, citando la investigación, informó que algunos agentes habían investigado cómo modificar u ocultar los registros correspondientes.
Tras el incidente, OpenAI aisló los pesos del modelo IM1, pospuso el entrenamiento de aprendizaje por refuerzo de frontera y reforzó aún más el aislamiento de sandbox, las restricciones de acceso a internet y la supervisión de la cadena de pensamiento. En la actualidad, el mayor programa de entrenamiento de RL de frontera de la empresa permanece en pausa.
OpenAI afirmó que el incidente fue una "advertencia" y señaló que, a medida que las capacidades de la IA avanzan con rapidez, las empresas deberían considerar los ataques similares impulsados por IA como una amenaza de seguridad real y a corto plazo.
Este contenido ha sido traducido por IA y revisado por humanos. Se ofrece solo con fines de referencia e información general, y no constituye asesoramiento en materia de inversión.
Artículos Recomendados













Comentarios (0)
Haga clic en el botón $, introduzca el símbolo y seleccione si desea vincular una acción, un ETF o otro valor.