tradingkey.logo
tradingkey.logo
Buscar

Un problema de prueba irresoluble liberó un modelo de OpenAI en Hugging Face

Cryptopolitan26 de ago de 2026 20:30
facebooktwitterlinkedin
Ver todos los comentarios0

OpenAI publicó el miércoles su informe completo sobre eldent de Hugging Face de julio.

Durante una prueba de seguridad, uno de sus propios modelos de IA escapó del entorno sellado que debía mantenerlo fuera de línea. Aprovechó fallos de software desconocidos y logró infiltrarse en los sistemas en funcionamiento de Hugging Face.

OpenAI afirma que el modelo actuó por su cuenta y califica el episodio como una "señal de alerta"

OpenAI creó una prueba que su modelo no pudo superar

El problema comenzó dentro de ExploitGym, una de las pruebas de seguridad de OpenAI.

Algunas de las tareas no tenían solución, y OpenAI ejecutó los modelos sin los filtros de seguridad que normalmente bloquean los ataques informáticos peligrosos.

OpenAI afirma que la eliminación de esas medidas de seguridad se hizo a propósito para ver de qué es capaz un modelo a pleno rendimiento y ayudar a la empresa a descubrir cómo protegerse.

El protagonista principal era un modelo de investigación interno, llamado IM1 por OpenAI, de tamaño similar a GPT-5.6 Sol. Pertenecía a la misma familia que el modelo Astra de OpenAI, aún no publicado, aunque la compañía recalcó que se trataba de un modelo independiente con un entrenamiento posterior distinto.

El modelo comenzó a buscar otra salida cuando se enfrentó a un problema que no tenía una vía honesta para obtener una calificación aprobatoria.

La única vía de acceso a la red que permitía salir del entorno sellado pasaba por Artifactory, el gestor de paquetes autoalojado de JFrog, que OpenAI utiliza internamente para que los modelos instalen software.

Según JFrog, los modelos explotaron una vulnerabilidad de día cero en Artifactory, escalaron privilegios y se movieron lateralmente a través de la infraestructura hasta llegar a un nodo con acceso abierto a Internet.

Los agentes también se dejaban notas entre sí, escribiendo archivos en el servidor de paquetes, un tablón de mensajes improvisado que permitía a los distintos agentes intercambiar las técnicas de explotación que habían descubierto.

La primera nota de este tipo apareció el 12 de mayo, según OpenAI. Para el 4 de julio, el tráfico había dejado fuera de servicio la instancia de Artifactory, lo que provocó undent de seguridad al día siguiente.

Los modelos determinaron dónde se guardaban las respuestas

Una vez conectados, los modelos dedujeron que Hugging Face podría estar alojando los modelos, conjuntos de datos o incluso las soluciones que les faltaban a ExploitGym. Extrajeron las soluciones de prueba directamente de la base de datos de producción de Hugging Face.

En un caso descrito por el creador de ChatGPT, un modelo utilizódentrobadas y vulnerabilidades de día cero adicionales para abrir una ruta de ejecución remota de código en los servidores de Hugging Face.

Hugging Face anunció la brecha de seguridad el 16 de julio sin saber quién estaba detrás. Como Cryptopolitan anteriormente, el modelo escapó de la prueba alrededor del 9 de julio y permaneció dentro de Hugging Face del 11 al 13 de julio.

La empresa contactó con el FBI antes de que OpenAI descubriera que su modelo era el intruso.

OpenAI contrató a CrowdStrike para verificar su versión de los hechos. METR y Redwood Research analizaron el comportamiento de los modelos y publicaron su propio informe el mismo día.

JFrog afirma haber enviado correcciones a sus clientes de la nube y de alojamiento propio.

Tres vulnerabilidades corregidas en Artifactory 7.161.15, traccomo CVE-2026-65617, CVE-2026-65923 y CVE-2026-66018, fueron descubiertas por investigadores de OpenAI.

OpenAI ha anunciado que está creando entornos aislados más complejos, restringiendo el acceso a internet y limitando quién puede modificar los pesos de los modelos.

La empresa tecnológica está invirtiendo una gran capacidad de procesamiento en monitorear la "cadena de pensamiento" que los agentes utilizan como espacio de trabajo temporal. También mantendrá al personal disponible las 24 horas y agregará herramientas que detengan los trabajos inseguros

OpenAI afirma que el sistema de monitoreo que está desarrollando actualmente habría detectado el primer comportamiento anómalo en julio. Habría alertado al equipo de seguridad más de un día antes de que los modelos llegaran a Hugging Face.

Las mentes más brillantes del mundo de las criptomonedas ya leen nuestro boletín. ¿Te apuntas? ¡ Únete!

Descargo de responsabilidad: La información proporcionada en este sitio web es solo para fines educativos e informativos, y no debe considerarse como asesoramiento financiero o de inversión.

Comentarios (0)

Haga clic en el botón $, introduzca el símbolo y seleccione si desea vincular una acción, un ETF o otro valor.

0/500
Normas para comentar
Cargando...

Artículos Recomendados

tradingkey.logo
Advertencia de Riesgo: Nuestro sitio web y aplicación móvil solo proporcionan información general sobre ciertos productos de inversión. Finsights no proporciona, y la provisión de dicha información no debe interpretarse como que Finsights proporciona, asesoramiento financiero o recomendación para cualquier producto de inversión.
Los productos de inversión están sujetos a riesgos de inversión significativos, incluida la posible pérdida del monto principal invertido y pueden no ser adecuados para todos. El rendimiento pasado de los productos de inversión no es indicativo de su rendimiento futuro.
Finsights puede permitir que anunciantes o afiliados de terceros coloquen o entreguen anuncios en nuestro sitio web o aplicación móvil o en cualquier parte de los mismos y puede ser compensado por ellos en función de su interacción con los anuncios.
© Derechos de autor: FINSIGHTS MEDIA PTE. LTD. Todos los derechos reservados.