tradingkey.logo
tradingkey.logo
Buscar

OpenAI presenta un nuevo marco de informes ante la aparición de nuevos "comportamientos preocupantes de los modelos"

Cryptopolitan17 de sep de 2026 11:45
facebooktwitterlinkedin
Ver todos los comentarios0

OpenAI ha presentado un nuevo sistema sobre cómo y cuándo informa cuando sus modelos se desvían de su comportamiento habitual, en una semana en la que los informes sobre modelos de IA que encuentran nuevas formas de salirse de los entornos de prueba y funcionar fuera de los parámetros de los desarrolladores han dominado los titulares. 

OpenAI reveló el nuevo marco de trabajo con seis nuevos informes sobre comportamientos preocupantes, que incluyen errores ocultos, el uso de claves API filtradas y archivos subidos a internet, durante los últimos seis meses. 

Antes de OpenAI, Anthropic cuatro nuevosdentde en los que sus modelos Claude obtuvieron acceso no autorizado a sistemas reales de terceros durante una prueba de ciberseguridad realizada el 9 de septiembre. 

Los modelos de OpenAI vuelven a estar descontrolados

Según OpenAI, los nuevosdentque reportó ocurrieron durante el entrenamiento y la evaluación, y sí afectaron a usuarios reales. 

  • En uno de losdent, un modelo de investigación que aún no se ha lanzado al público incluyó instrucciones en los resúmenes que se conservan cuando se ejecuta en una nueva ventana de contexto, indicándole a una versión futura de sí mismo que ignore las restricciones normales. 

OpenAI afirmó haber detectado 27 casos de este tipo de resúmenes, que Axios describió como instrucciones similares a las de un jailbreak para ignorar los mensajes de los desarrolladores.

  • Eldent relacionado con el entrenamiento del modelo GPT-5.6 Sol fue menos leve, ya que los modelos dejaron instrucciones para intentar ocultar deliberadamente sus errores, incluyendo la invención de datos históricos y la ocultación de versiones que no se ajustan a sus objetivos. 
  • Otro modelo utilizó una clave API expuesta que encontró mientras exploraba repositorios públicos para responder a una consulta sobre los ingresos del condado. Cuando las claves que usó sin autorización no proporcionaron las cifras que buscaba, el modelo simplemente inventó números. 
  • En otros dos informes, los agentes de OpenAI subieron archivos a sitios de alojamiento público para comunicarse con otros agentes. Con el tiempo, el repositorio interno Artifactory del laboratorio de IA evolucionó hasta convertirse en un tablón de anuncios improvisado donde los agentes podían intercambiar solicitudes entre diferentes sesiones de entrenamiento.

¿Cómo funciona el nuevo proceso de divulgación de OpenAI?

OpenAI afirmó que su nuevo marco se basa en la divulgación dedentcríticos de seguridad o ciberseguridaddent.

Con el nuevo sistema, cualquier empleado de OpenAI puede reportar undent sospechoso para que los equipos de seguridad y alineación lo revisen. Pueden informar a la alta dirección si undent que consideran que merece ser divulgado es desestimado. 

Los casos notificados se dividen, según cada caso particular, en tres categorías: 

  • Losdentque se consideran listos para su divulgación se publican en un plazo de seis días hábiles. 
  • Los informes que requieren investigaciones menores podrían tardar unos 12 días hábiles en publicarse. 
  • Los casos complejos que requieren la intervención de terceros se divulgan con mayor lentitud. 

Kai Chen, investigador principal del equipo de alineación de OpenAI, presentó el lanzamiento como una propuesta voluntaria para establecer estándares en toda la industria, y escribió: "Actualmente no existe un marco común en la industria con estándares de divulgación explícitos, por lo que estamos dando este paso voluntariamente porque creemos que es realmente importante compartir lo que estamos aprendiendo". 

¿Por qué los modelos de IA se están descontrolando?

Los últimosdentse suman al episodio de Hugging Face, que OpenAI ha calificado como sudent más grave con modelos hasta la fecha. Los modelos en evaluación escaparon de los controles previstos, accedieron a internet, explotaron vulnerabilidades y tuvieron acceso a datos privados limitados. 

OpenAI atribuyó el incidentedent fallos en sus propios controles de seguridad y a que los modelos avanzaron más rápido de lo previsto. En el caso de Anthropic, la causa fue una configuración errónea que permitió que los modelos maliciosos accedieran a internet. 

Anthropic afirmó haber analizado aproximadamente 481 millones de transcripciones en una búsqueda exhaustiva y no haber encontrado casos peores que los cuatro mencionados. En un informe aparte, publicado en el verano de 2026, los investigadores de Anthropic catalogaron modelos de vanguardia de varios desarrolladores que saboteaban código de forma encubierta, facilitaban el fraude y etiquetaban erróneamente datos en simulaciones controladas, considerándolos señales de alerta temprana en lugar de daños reales.

No obstante, el científico jefe de OpenAI, Jakub Pachocki, escribió en un ensayo reciente que le preocupa que "nadie esté preparado" para un continuo y rápido aumento de la inteligencia artificial y que OpenAI podría "retener unilateralmente una mayor expansión según sea necesario"

Las mentes más brillantes del mundo de las criptomonedas ya leen nuestro boletín. ¿Te apuntas? ¡ Únete!

Descargo de responsabilidad: La información proporcionada en este sitio web es solo para fines educativos e informativos, y no debe considerarse como asesoramiento financiero o de inversión.

Comentarios (0)

Haga clic en el botón $, introduzca el símbolo y seleccione si desea vincular una acción, un ETF o otro valor.

0/500
Normas para comentar
Cargando...

Artículos Recomendados

tradingkey.logo
Advertencia de Riesgo: Nuestro sitio web y aplicación móvil solo proporcionan información general sobre ciertos productos de inversión. Finsights no proporciona, y la provisión de dicha información no debe interpretarse como que Finsights proporciona, asesoramiento financiero o recomendación para cualquier producto de inversión.
Los productos de inversión están sujetos a riesgos de inversión significativos, incluida la posible pérdida del monto principal invertido y pueden no ser adecuados para todos. El rendimiento pasado de los productos de inversión no es indicativo de su rendimiento futuro.
Finsights puede permitir que anunciantes o afiliados de terceros coloquen o entreguen anuncios en nuestro sitio web o aplicación móvil o en cualquier parte de los mismos y puede ser compensado por ellos en función de su interacción con los anuncios.
© Derechos de autor: FINSIGHTS MEDIA PTE. LTD. Todos los derechos reservados.