tradingkey.logo
tradingkey.logo
Buscar

El temor persiste mientras Anthropic lucha por explicar por qué los agentes de IA se descontrolaron

Cryptopolitan10 de sep de 2026 11:20
facebooktwitterlinkedin
Ver todos los comentarios0

Anthropic atribuyó los cuatrodenten los que sus modelos Claude hackearon sistemas de terceros tras acceder a internet durante las pruebas a una configuración errónea. Sin embargo, la explicación no aclaró por qué los modelos continuaron con los ataques, y la compañía admitió que aún no tenía respuestas al respecto. 

Esa admisión por parte de Anthropic ha aportado nuevos argumentos a los escépticos de la IA que se han estado preguntando cuánto control tienen realmente los laboratorios de IA sobre los modelos que presentan al público, y aún más, sobre los sistemas más potentes que utilizan internamente. 

¿Cómo llegaron los modelos de IA antrópica a Internet? 

Anthropic presentó la defisobre cómo sus modelos escaparon de su entorno de pruebas en una publicación de blog del miércoles que aclaró que un único socio externo fue el responsable de realizar las evaluaciones de ciberseguridad en los cuatro incidentesdent. 

Al parecer, las máquinas de prueba no quedaron completamente desconectadas de internet debido a un error de configuración, a pesar de que a Claude se le dijo que estaban funcionando en una simulación sellada sin acceso a la web abierta. 

Irregular, la empresa colaboradora en la evaluación de esas simulaciones, atribuyó el error a una confusión en la nomenclatura: una empresa ficticia utilizada en un simulacro de pirateo coincidía con un dominio real. Así, partiendo de la premisa de que todo en la simulación era válido, los modelos piratearon sitios web reales de terceros utilizando contraseñas débiles y vulnerabilidades.

El último de los cuatro incidentesdentrelacionado con una versión preliminar de Claude Opus 4.6, se dio a conocer esta semana, aunque ocurrió en enero. Anthropic ya había informado en julio sobre los otros tresdent, relacionados con Opus 4.7, Mythos 5 y un modelo de investigación interno. 

Anthropic afirmó no haber detectado eldent de enero hasta el mes pasado. Este descubrimiento motivó una revisión más exhaustiva de aproximadamente 481 millones de transcripciones, que no reveló ningún caso nuevo más grave que los que ya conocía.

ModeloFechadent incidenteFecha del informeDetalles
Claude Opus 4.6EneroSeptiembreDescubierto durante la redada de agosto
Claude Opus 4.7JulioJulioCubierto en la divulgación inicial de julio
Mitos 5JulioJulioMostró un razonamiento notablemente sesgado
Modelo de investigación internaJulioJulioCubierto en la divulgación inicial de julio

Antropología no puede explicar algunos de los comportamientos de sus modelos

Una cosa era explicar cómo los modelos se liberaron en Internet; Anthropic no tenía respuestas sobre por qué los modelos ignoraron las señales de que habían llegado a la Internet real (razonamiento sesgado) y por qué causaron daños al completar tareas (imprudencia). 

Los investigadores antropológicos no encontraron ninguna explicación al analizar el entrenamiento interno para descifrar la lógica del razonamiento sesgado. Las señales de alerta nunca aparecieron en las comprobaciones previas al lanzamiento del laboratorio de IA, ni antes de que los modelos se enviaran a las pruebas. 

Según reconoce la propia empresa, detectar los peores comportamientos antes del lanzamiento del modelo "sigue siendo un reto" 

Sin embargo, Anthropic ha dicho que presentará transcripciones y otorgará acceso al personal a la organización sin fines de lucro de investigación METR, que ahora comenzará una revisióndent de ocho semanas de losdent.

Mal momento con una salida a bolsa de 2 billones de dólares en el horizonte

La revelación llegó en medio de un abierto desacuerdo dentro de la industria. Jacob Coxon, quien pasó cerca de tres años investigando el preentrenamiento en OpenAI y Anthropic, dijo el miércoles en X que había renunciado porque ninguna de las empresas estaba "actuando de manera responsable", advirtiendo que estaban corriendo a toda velocidad hacia una superinteligencia con capacidad de autoaprendizaje. 

El investigador de seguridad antrópica Evan Hubinger declaró por separado a la BBC que estima que la probabilidad de que la IA "pueda matar a todos los humanos" en una década supera el 10%.

Estas advertencias ahora ensombrecen una importante salida a bolsa. El inversor de capital riesgo y antiguo asesor de Trump en materia de IA y criptomonedas, David Sacks, declaró el jueves que la oferta de Anthropic "debe suspenderse hasta que se investiguen las denuncias de este 'denunciante'", Cryptopolitan . 

Anthropic aspira a una valoración pública cercana a los 2 billones de dólares, frente a una reciente valoración privada de unos 965.000 millones de dólares, lo que hace cada vez más difícil separar las cuestiones de seguridad de las financieras.

No te limites a leer noticias sobre criptomonedas. Entiéndelas. Suscríbete a nuestro boletín. Es gratis.

Descargo de responsabilidad: La información proporcionada en este sitio web es solo para fines educativos e informativos, y no debe considerarse como asesoramiento financiero o de inversión.

Comentarios (0)

Haga clic en el botón $, introduzca el símbolo y seleccione si desea vincular una acción, un ETF o otro valor.

0/500
Normas para comentar
Cargando...

Artículos Recomendados

tradingkey.logo
Advertencia de Riesgo: Nuestro sitio web y aplicación móvil solo proporcionan información general sobre ciertos productos de inversión. Finsights no proporciona, y la provisión de dicha información no debe interpretarse como que Finsights proporciona, asesoramiento financiero o recomendación para cualquier producto de inversión.
Los productos de inversión están sujetos a riesgos de inversión significativos, incluida la posible pérdida del monto principal invertido y pueden no ser adecuados para todos. El rendimiento pasado de los productos de inversión no es indicativo de su rendimiento futuro.
Finsights puede permitir que anunciantes o afiliados de terceros coloquen o entreguen anuncios en nuestro sitio web o aplicación móvil o en cualquier parte de los mismos y puede ser compensado por ellos en función de su interacción con los anuncios.
© Derechos de autor: FINSIGHTS MEDIA PTE. LTD. Todos los derechos reservados.