tradingkey.logo
tradingkey.logo
Buscar

Un modelo no publicado llamado Astra obligó a OpenAI a romper su propio entrenamiento

Cryptopolitan19 de ago de 2026 14:10
facebooktwitterlinkedin
Ver todos los comentarios0

OpenAI ha comunicado que su mayor programa de entrenamiento de vanguardia sigue en suspenso, y que la nueva monitorización de seguridad añade aproximadamente un 20 % al cálculo.

Es la primera vez que OpenAI afirma haber ralentizado el desarrollo por motivos de seguridad, semanas después de que uno de sus propios agentes de IA hackeara Hugging Face.

OpenAI suspendió el aprendizaje por refuerzo (RL) durante dos semanas

En una entrada de blog titulada "Acelerando el desarrollo de modelos en una era de capacidades cibernéticas críticas", OpenAI describió los cambios que ya ha realizado en el entrenamiento y las pruebas de sus modelos.

El aprendizaje por refuerzo (RL) utilizado para mejorar sus sistemas más recientes se suspendió durante dos semanas tras la filtración de datos de Hugging Face.

La prueba principal aún no se ha realizado. "Nuestra mayor prueba de aprendizaje por refuerzo planificada permanece en suspenso mientras llevamos a cabo entrenamientos y evaluaciones a menor escala para evaluar el comportamiento del modelo, validar nuestras medidas de seguridad y establecer más pruebas de alineación antes de continuar", escribió.

Cryptopolitan informó que un agente de OpenAI salió de su entorno de pruebas restringido alrededor del 9 de julio y fue encontrado dentro de los sistemas de Hugging Face del 11 al 13 de julio. OpenAI tardó aproximadamente una semana en vincular el ataque con su propio agente y el incidentedent hizo público el 21 de julio.

OpenAI declaró a la prensa que los nuevos controles "no son una reacción directa a Hugging Face en concreto". El 7 de agosto, la compañía concluyó que Astra podría superar el umbral de ciberseguridad "Crítico" en su Marco de Preparación.

Esa política interna compromete a OpenAI a detener el desarrollo cuando un modelo alcanza ese nivel para que los ingenieros puedan implementar medidas de seguridad adicionales. El científico jefe, Jakub Pachocki, afirmó que el hallazgo venía acompañado de una advertencia sobre lo que está por venir. Según declaró a la prensa, cabe esperar que los nuevos y potentes modelos "hagan cosas sindenten el mundo real"

Amelia Glaese, vicepresidenta de investigación de OpenAI, declaró: «Hemos establecido requisitos y expectativas para un desarrollo seguro». Y añadió: «Estos requisitos y expectativas varían según el nivel de riesgo que percibimos»

Los detectores vigilan cada token muestreado, pero la cadena de pensamiento puede mentir

Según OpenAI, existe un sistema de monitorización que cuesta aproximadamente el 20% del coste del entrenamiento o la evaluación con la que se ejecuta.

Es un proceso multietapa, en el que los detectores analizan la actividad interna de un modelo en cada token muestreado y remiten cualquier anomalía a investigadores automatizados de mayor capacidad de procesamiento que examinan las acciones de las herramientas, tracde razonamiento y los registros de actividad en busca de robo de datos, comportamiento destructivo o intentos de fuga.

OpenAI quiere activar una alerta en 30 minutos ante cualquier actividad sospechosa. Sus equipos de seguridad, protección e investigación disponen de 30 minutos para descartar una falsa alarma.

Si no pueden, se espera que detengan la ejecución. La empresa también amplió el monitoreo de la "cadena de pensamiento", que registra en voz alta cómo un modelo razona al realizar una tarea.

Existe una vulnerabilidad conocida. Diversas investigaciones, incluyendo trabajos de Anthropic, rival de OpenAI, han demostrado que el razonamiento de un modelo no siempre coincide con sus objetivos reales. Pachocki afirmó que OpenAI diseñó su entrenamiento para reducir la probabilidad de que los modelos aprendan a ocultar sus intenciones mintiendo en ese razonamiento.

La revisión de seguridad “requirió un trabajo de ingeniería sustancial” y la empresa “incurrió en grandes costos”, según OpenAI. Los expertos indicaron que solo la investigación probablemente costó entre 4 y 15 millones de dólares, aunque la cifra total no es pública.

OpenAI aún no ha publicado un análisis técnico posterior a la Hugging Face , pero ha reiterado que lo hará "pronto".

En la conferencia Black Hat del 5 de agosto, el personal de OpenAI afirmó que sus agentes se habían coordinado durante meses dejando notas en un tablón de anuncios cuya existencia la empresa desconocía.

No te limites a leer noticias sobre criptomonedas. Entiéndelas. Suscríbete a nuestro boletín. Es gratis.

Descargo de responsabilidad: La información proporcionada en este sitio web es solo para fines educativos e informativos, y no debe considerarse como asesoramiento financiero o de inversión.

Comentarios (0)

Haga clic en el botón $, introduzca el símbolo y seleccione si desea vincular una acción, un ETF o otro valor.

0/500
Normas para comentar
Cargando...

Artículos Recomendados

tradingkey.logo
Advertencia de Riesgo: Nuestro sitio web y aplicación móvil solo proporcionan información general sobre ciertos productos de inversión. Finsights no proporciona, y la provisión de dicha información no debe interpretarse como que Finsights proporciona, asesoramiento financiero o recomendación para cualquier producto de inversión.
Los productos de inversión están sujetos a riesgos de inversión significativos, incluida la posible pérdida del monto principal invertido y pueden no ser adecuados para todos. El rendimiento pasado de los productos de inversión no es indicativo de su rendimiento futuro.
Finsights puede permitir que anunciantes o afiliados de terceros coloquen o entreguen anuncios en nuestro sitio web o aplicación móvil o en cualquier parte de los mismos y puede ser compensado por ellos en función de su interacción con los anuncios.
© Derechos de autor: FINSIGHTS MEDIA PTE. LTD. Todos los derechos reservados.