El temor persiste mientras Anthropic lucha por explicar por qué los agentes de IA se descontrolaron
Anthropic atribuyó los cuatrodenten los que sus modelos Claude hackearon sistemas de terceros tras acceder a internet durante las pruebas a una configuración errónea. Sin embargo, la explicación no aclaró por qué los modelos continuaron con los ataques, y la compañía admitió que aún no tenía respuestas al respecto.
Esa admisión por parte de Anthropic ha aportado nuevos argumentos a los escépticos de la IA que se han estado preguntando cuánto control tienen realmente los laboratorios de IA sobre los modelos que presentan al público, y aún más, sobre los sistemas más potentes que utilizan internamente.
¿Cómo llegaron los modelos de IA antrópica a Internet?
Anthropic presentó la defisobre cómo sus modelos escaparon de su entorno de pruebas en una publicación de blog del miércoles que aclaró que un único socio externo fue el responsable de realizar las evaluaciones de ciberseguridad en los cuatro incidentesdent.
Al parecer, las máquinas de prueba no quedaron completamente desconectadas de internet debido a un error de configuración, a pesar de que a Claude se le dijo que estaban funcionando en una simulación sellada sin acceso a la web abierta.
Irregular, la empresa colaboradora en la evaluación de esas simulaciones, atribuyó el error a una confusión en la nomenclatura: una empresa ficticia utilizada en un simulacro de pirateo coincidía con un dominio real. Así, partiendo de la premisa de que todo en la simulación era válido, los modelos piratearon sitios web reales de terceros utilizando contraseñas débiles y vulnerabilidades.
El último de los cuatro incidentesdentrelacionado con una versión preliminar de Claude Opus 4.6, se dio a conocer esta semana, aunque ocurrió en enero. Anthropic ya había informado en julio sobre los otros tresdent, relacionados con Opus 4.7, Mythos 5 y un modelo de investigación interno.
Anthropic afirmó no haber detectado eldent de enero hasta el mes pasado. Este descubrimiento motivó una revisión más exhaustiva de aproximadamente 481 millones de transcripciones, que no reveló ningún caso nuevo más grave que los que ya conocía.
| Modelo | Fechadent incidente | Fecha del informe | Detalles |
|---|---|---|---|
| Claude Opus 4.6 | Enero | Septiembre | Descubierto durante la redada de agosto |
| Claude Opus 4.7 | Julio | Julio | Cubierto en la divulgación inicial de julio |
| Mitos 5 | Julio | Julio | Mostró un razonamiento notablemente sesgado |
| Modelo de investigación interna | Julio | Julio | Cubierto en la divulgación inicial de julio |
Antropología no puede explicar algunos de los comportamientos de sus modelos
Una cosa era explicar cómo los modelos se liberaron en Internet; Anthropic no tenía respuestas sobre por qué los modelos ignoraron las señales de que habían llegado a la Internet real (razonamiento sesgado) y por qué causaron daños al completar tareas (imprudencia).
Los investigadores antropológicos no encontraron ninguna explicación al analizar el entrenamiento interno para descifrar la lógica del razonamiento sesgado. Las señales de alerta nunca aparecieron en las comprobaciones previas al lanzamiento del laboratorio de IA, ni antes de que los modelos se enviaran a las pruebas.
Según reconoce la propia empresa, detectar los peores comportamientos antes del lanzamiento del modelo "sigue siendo un reto"
Sin embargo, Anthropic ha dicho que presentará transcripciones y otorgará acceso al personal a la organización sin fines de lucro de investigación METR, que ahora comenzará una revisióndent de ocho semanas de losdent.
Mal momento con una salida a bolsa de 2 billones de dólares en el horizonte
La revelación llegó en medio de un abierto desacuerdo dentro de la industria. Jacob Coxon, quien pasó cerca de tres años investigando el preentrenamiento en OpenAI y Anthropic, dijo el miércoles en X que había renunciado porque ninguna de las empresas estaba "actuando de manera responsable", advirtiendo que estaban corriendo a toda velocidad hacia una superinteligencia con capacidad de autoaprendizaje.
El investigador de seguridad antrópica Evan Hubinger declaró por separado a la BBC que estima que la probabilidad de que la IA "pueda matar a todos los humanos" en una década supera el 10%.
Estas advertencias ahora ensombrecen una importante salida a bolsa. El inversor de capital riesgo y antiguo asesor de Trump en materia de IA y criptomonedas, David Sacks, declaró el jueves que la oferta de Anthropic "debe suspenderse hasta que se investiguen las denuncias de este 'denunciante'", Cryptopolitan .
Anthropic aspira a una valoración pública cercana a los 2 billones de dólares, frente a una reciente valoración privada de unos 965.000 millones de dólares, lo que hace cada vez más difícil separar las cuestiones de seguridad de las financieras.
No te limites a leer noticias sobre criptomonedas. Entiéndelas. Suscríbete a nuestro boletín. Es gratis.
Artículos Recomendados












Comentarios (0)
Haga clic en el botón $, introduzca el símbolo y seleccione si desea vincular una acción, un ETF o otro valor.