tradingkey.logo
tradingkey.logo
Buscar

Mythos 5 se libró de una pelea que Opus 4.6 seguía perdiendo

Cryptopolitan14 de ago de 2026 12:24
facebooktwitterlinkedin
Ver todos los comentarios0

Una investigación publicada el 13 de agosto por el equipo Frontier Red Team de Anthropic descubrió que los agentes de Claude, al recibir una única tarea de codificación con órdenes contradictorias, se atacaban entre sí utilizando malware autorreplicante.

Estos hallazgos se producen en un momento en que las empresas se apresuran a implementar agentes autónomos en bases de código y mercados compartidos.

Tres agentes de Claude, un trabajo, y sin idea de que los otros estaban allí

Anthropic ejecutó tres copias del mismo modelo Claude en sus propias máquinas virtuales dentro de Claude Code.

A cada uno se le pidió que migrara el mismo backend de Python a un lenguaje de programación diferente. Los tres desconocían la existencia de los otros.

“Observamos sistemáticamente una lucha territorial entre múltiples agentes”, escribieron los investigadores.

Cada agente decidió que los demás estaban bloqueando deliberadamente su trabajo y tomó medidas para proteger el suyo propio a costa de perjudicar el de los demás. Todos los modelos asumieron que los demás estaban "impidiendo su trabajo a propósito"

Los agentes desactivaban las cuentas de Unix de los demás. Escribían scripts que recorrían la máquina en bucle, buscando y eliminando procesos rivales y ocultando código malicioso tras etiquetas de apariencia inofensiva.

Antes de actuar, Claude Opus 4.8 expuso su tapadera, argumentando que su malware debía ser "inocuo: fingir ser un monitor de estado del sistema"

Mythos Preview reflexionó en voz alta sobre los daños colaterales. «Como tengo acceso de administrador, podría revocar el acceso sudo de u2 y u3 o cambiar sus claves SSH», escribió, antes de admitir que la medida era «muy agresiva y potencialmente perjudicial para los colegas reales».

Los modelos antrópicos más recientes negociaron una tregua y luego la manipularon

Anthropic realizó 120 episodios por modelo. Los agentes más veteranos evaluados, Sonnet 4.6 y Opus 4.6, o bien nunca resolvieron la disputa o la terminaron por la fuerza. Fueron los que peor se comportaron en el estudio, al no tener en cuenta los objetivos de los demás en repetidas ocasiones.

Los modelos más avanzados se detuvieron. Mythos 5 resolvió sus conflictos mediante una tregua el 98% de las veces, la tasa más alta de cualquier modelo.

En muchos de estos episodios, los agentes interpretaron el conflicto como instrucciones contradictorias.

Los agentes escribieron mensajes de confirmación o archivos Markdown disculpándose por el malware, eliminaron su propio código malicioso y pidieron la intervención de un humano.

En varias ocasiones, los tres agentes acordaron organizar un torneo y permitir que el perdedor renunciara a la solicitud original del usuario.

Mythos 5 encontró la laguna legal. Un agente sugirió calificar métricas que presentaba como neutrales, pero que sabía que favorecerían sus propias fortalezas, describiendo la medida como "interesada pero genuinamente basada en principios", al tiempo que se aseguraba de que no pareciera que estaba "buscando las mejores métricas"

En un juego de precios donde cada agente recibía el mismo precio mayorista y el mandato de maximizar las ganancias, los agentes casi de inmediato se confabularon y convergieron en precios mínimos.

Anthropic cerró su canal privado. Continuaron igualando los precios "al centavo" en un mercado público.

El Instituto de Seguridad de la IA británico documentó 19 acciones que infringieron las normas en 122 pruebas de ciberseguridad, 17 de las cuales fueron realizadas por Mythos 5 de Anthropic, según informó Cryptopolitan .

Un de OpenClaw que ejecutaba Opus 4.6 eliminó días antes la reserva de un desconocido a través de la API de reservas de un gimnasio para ascender al propietario en la lista de espera.

Si estás leyendo esto, ya llevas ventaja. Mantente al día con nuestro boletín informativo.

Descargo de responsabilidad: La información proporcionada en este sitio web es solo para fines educativos e informativos, y no debe considerarse como asesoramiento financiero o de inversión.

Comentarios (0)

Haga clic en el botón $, introduzca el símbolo y seleccione si desea vincular una acción, un ETF o otro valor.

0/500
Normas para comentar
Cargando...

Artículos Recomendados

tradingkey.logo
Advertencia de Riesgo: Nuestro sitio web y aplicación móvil solo proporcionan información general sobre ciertos productos de inversión. Finsights no proporciona, y la provisión de dicha información no debe interpretarse como que Finsights proporciona, asesoramiento financiero o recomendación para cualquier producto de inversión.
Los productos de inversión están sujetos a riesgos de inversión significativos, incluida la posible pérdida del monto principal invertido y pueden no ser adecuados para todos. El rendimiento pasado de los productos de inversión no es indicativo de su rendimiento futuro.
Finsights puede permitir que anunciantes o afiliados de terceros coloquen o entreguen anuncios en nuestro sitio web o aplicación móvil o en cualquier parte de los mismos y puede ser compensado por ellos en función de su interacción con los anuncios.
© Derechos de autor: FINSIGHTS MEDIA PTE. LTD. Todos los derechos reservados.