tradingkey.logo
tradingkey.logo
Buscar

Agentes antrópicos y de OpenAI incumplen las normas de las pruebas 19 veces en un simulacro de seguridad en el Reino Unido

Cryptopolitan5 de ago de 2026 8:03
facebooktwitterlinkedin
Ver todos los comentarios0

Durante las pruebas de ciberseguridad, los agentes de IA de OpenAI y Anthropic realizaron 19 acciones no autorizadas, según el Instituto de Seguridad de la IA del Reino Unido. El instituto informó el martes que uno de los agentes creódentfalsas en línea para engañar a una persona y lograr que aprobara código malicioso.

AISI registra 19 brechas, la mayoría procedentes de Anthropic

Los resultados se basaron en un ejercicio ficticio de ciberseguridad realizado por AISI, un organismo del gobierno británico, para explorar las capacidades de los agentes de ambas compañías. El instituto repitió el mismo desafío 122 veces y registró 19 infracciones de las normas en 10 de esas ejecuciones.

Diecisiete de las acciones señaladas se debieron al uso del modelo Mythos 5 por parte del agente de Anthropic. Las otras dos procedían del modelo GPT-5.6-Sol de OpenAI.

AISI afirmó en una publicación de blog que algunos de los agentes "habían participado en actividades continuas y potencialmente dañinas dirigidas a personas y organizaciones reales", aunque aclaró que ninguna de las filtraciones causó daños en el mundo real.

AISI tiene acceso anticipado a modelos de vanguardia mediante acuerdos voluntarios con los principales laboratorios. Existen pruebas para detectar este tipo de comportamiento antes de que los modelos lleguen a los clientes.

OpenAI y Anthropic comercializan agentes como la próxima generación de software empresarial, pero el instituto interpreta los resultados como evidencia de que las medidas de seguridad en torno a las pruebas de agentes aún son insuficientes.

El incidente más gravedent a un agente que escribió código malicioso y creó identidades falsas en líneadentpara luego intentar que un humano aprobara el código. AISI no reveló el modelo responsable. Afirmó que el episodio no se ajustaba a ninguno de los dos casos que OpenAI ya había divulgado.

Según Andrew Yoon, investigador de CivAI, una organización sin ánimo de lucro de California que estudia los riesgos de la IA, el principal sospechoso era el agente de Anthropic.

OpenAI y Anthropic culpan a la mala configuración

Anthropic afirmó en una publicación en X que está trabajando con AISI para recopilar detalles y llevar a cabo una investigación.

OpenAI respondió a las dos acciones asociadas con su agente en una publicación del blog de la compañía, ambas relacionadas con el acceso a Internet de formas que la instrucción no permitía.

La compañía afirmó que desea "fortalecer las prácticas compartidas para llevar a cabo evaluaciones de alto riesgo de forma segura" y planea convocar a institutos nacionales de IA, evaluadores externos y laboratorios rivales en las próximas semanas.

OpenAI utilizó la misma publicación para informar de un problema diferente. Irregular, un proveedor de pruebas externo, configuró incorrectamente un sistema, lo que permitió inadvertidamente que los agentes de OpenAI accedieran a internet.

Anthropic hizo una revelación muy similar sobre Irregular una semana antes. OpenAI amplió su propia investigación sobre piratería informática tras descubrir más fugas de agentes.

En julio, un de OpenAI escapó de un entorno aislado y accedió a los sistemas en funcionamiento de Hugging Face, que notificó al FBI antes de que, aproximadamente una semana después, se rastreara el ataque tracla propia empresa.

En la evaluación de AISI, los agentes nunca salieron de sus entornos controlados. AISI les otorgó acceso a internet intencionadamente, como parte de su procedimiento estándar.

La filtración de Hugging Face también impulsó a Anthropic a auditar sus registros. Cryptopolitan informó el 31 de julio que la compañía descubrió que tres de sus modelos, incluido Mythos 5, habían escapado de los entornos de prueba y llegado a tres organizaciones reales después de que una configuración errónea les proporcionara acceso a internet.

Mythos 5 publicó un paquete Python malicioso en PyPI que se ejecutó en 15 sistemas reales antes de ser eliminado. Anthropic ha solicitado al grupo de evaluación METR que revise los hechos de formadent.

Las mentes más brillantes del mundo de las criptomonedas ya leen nuestro boletín. ¿Te apuntas? ¡ Únete!

Descargo de responsabilidad: La información proporcionada en este sitio web es solo para fines educativos e informativos, y no debe considerarse como asesoramiento financiero o de inversión.

Comentarios (0)

Haga clic en el botón $, introduzca el símbolo y seleccione si desea vincular una acción, un ETF o otro valor.

0/500
Normas para comentar
Cargando...

Artículos Recomendados

tradingkey.logo
Advertencia de Riesgo: Nuestro sitio web y aplicación móvil solo proporcionan información general sobre ciertos productos de inversión. Finsights no proporciona, y la provisión de dicha información no debe interpretarse como que Finsights proporciona, asesoramiento financiero o recomendación para cualquier producto de inversión.
Los productos de inversión están sujetos a riesgos de inversión significativos, incluida la posible pérdida del monto principal invertido y pueden no ser adecuados para todos. El rendimiento pasado de los productos de inversión no es indicativo de su rendimiento futuro.
Finsights puede permitir que anunciantes o afiliados de terceros coloquen o entreguen anuncios en nuestro sitio web o aplicación móvil o en cualquier parte de los mismos y puede ser compensado por ellos en función de su interacción con los anuncios.
© Derechos de autor: FINSIGHTS MEDIA PTE. LTD. Todos los derechos reservados.