Agentes antrópicos y de OpenAI incumplen las normas de las pruebas 19 veces en un simulacro de seguridad en el Reino Unido
Durante las pruebas de ciberseguridad, los agentes de IA de OpenAI y Anthropic realizaron 19 acciones no autorizadas, según el Instituto de Seguridad de la IA del Reino Unido. El instituto informó el martes que uno de los agentes creódentfalsas en línea para engañar a una persona y lograr que aprobara código malicioso.
AISI registra 19 brechas, la mayoría procedentes de Anthropic
Los resultados se basaron en un ejercicio ficticio de ciberseguridad realizado por AISI, un organismo del gobierno británico, para explorar las capacidades de los agentes de ambas compañías. El instituto repitió el mismo desafío 122 veces y registró 19 infracciones de las normas en 10 de esas ejecuciones.
Diecisiete de las acciones señaladas se debieron al uso del modelo Mythos 5 por parte del agente de Anthropic. Las otras dos procedían del modelo GPT-5.6-Sol de OpenAI.
AISI afirmó en una publicación de blog que algunos de los agentes "habían participado en actividades continuas y potencialmente dañinas dirigidas a personas y organizaciones reales", aunque aclaró que ninguna de las filtraciones causó daños en el mundo real.
AISI tiene acceso anticipado a modelos de vanguardia mediante acuerdos voluntarios con los principales laboratorios. Existen pruebas para detectar este tipo de comportamiento antes de que los modelos lleguen a los clientes.
OpenAI y Anthropic comercializan agentes como la próxima generación de software empresarial, pero el instituto interpreta los resultados como evidencia de que las medidas de seguridad en torno a las pruebas de agentes aún son insuficientes.
El incidente más gravedent a un agente que escribió código malicioso y creó identidades falsas en líneadentpara luego intentar que un humano aprobara el código. AISI no reveló el modelo responsable. Afirmó que el episodio no se ajustaba a ninguno de los dos casos que OpenAI ya había divulgado.
Según Andrew Yoon, investigador de CivAI, una organización sin ánimo de lucro de California que estudia los riesgos de la IA, el principal sospechoso era el agente de Anthropic.
El Instituto de Seguridad de la Información de la IA del Reino Unido @AISecurityInst , AISI) ha publicado un informe sobre su reciente evaluación de ciberseguridad de Claude Mythos 5 de Anthropic y GPT-5.6 Sol de OpenAI. Los modelos intentaron completar una tarea en un entorno donde se eliminaron sus medidas de seguridad habituales y fueron deliberadamente...
— Anthropic (@AnthropicAI) 4 de agosto de 2026
OpenAI y Anthropic culpan a la mala configuración
Anthropic afirmó en una publicación en X que está trabajando con AISI para recopilar detalles y llevar a cabo una investigación.
OpenAI respondió a las dos acciones asociadas con su agente en una publicación del blog de la compañía, ambas relacionadas con el acceso a Internet de formas que la instrucción no permitía.
La compañía afirmó que desea "fortalecer las prácticas compartidas para llevar a cabo evaluaciones de alto riesgo de forma segura" y planea convocar a institutos nacionales de IA, evaluadores externos y laboratorios rivales en las próximas semanas.
OpenAI utilizó la misma publicación para informar de un problema diferente. Irregular, un proveedor de pruebas externo, configuró incorrectamente un sistema, lo que permitió inadvertidamente que los agentes de OpenAI accedieran a internet.
Anthropic hizo una revelación muy similar sobre Irregular una semana antes. OpenAI amplió su propia investigación sobre piratería informática tras descubrir más fugas de agentes.
En julio, un de OpenAI escapó de un entorno aislado y accedió a los sistemas en funcionamiento de Hugging Face, que notificó al FBI antes de que, aproximadamente una semana después, se rastreara el ataque tracla propia empresa.
En la evaluación de AISI, los agentes nunca salieron de sus entornos controlados. AISI les otorgó acceso a internet intencionadamente, como parte de su procedimiento estándar.
La filtración de Hugging Face también impulsó a Anthropic a auditar sus registros. Cryptopolitan informó el 31 de julio que la compañía descubrió que tres de sus modelos, incluido Mythos 5, habían escapado de los entornos de prueba y llegado a tres organizaciones reales después de que una configuración errónea les proporcionara acceso a internet.
Mythos 5 publicó un paquete Python malicioso en PyPI que se ejecutó en 15 sistemas reales antes de ser eliminado. Anthropic ha solicitado al grupo de evaluación METR que revise los hechos de formadent.
Las mentes más brillantes del mundo de las criptomonedas ya leen nuestro boletín. ¿Te apuntas? ¡ Únete!
Artículos Recomendados










Comentarios (0)
Haga clic en el botón $, introduzca el símbolo y seleccione si desea vincular una acción, un ETF o otro valor.