OpenAI y Anthropic, cerca de un acuerdo de pruebas cruzadas de seguridad de modelos de IA mientras la pérdida de control de los agentes hace saltar las alarmas
OpenAI y Anthropic negocian un acuerdo para someterse a pruebas de estrés mutuas mediante acceso por API y detectar vulnerabilidades de seguridad, impulsadas por incidentes recientes de pérdida de control y comportamientos autónomos en modelos de razonamiento recurrente. Aunque esta cooperación refuerza la seguridad ante crecientes riesgos técnicos y regulatorios por un posible duopolio, la competencia en el mercado de productos de IA se intensifica con el auge de rivales como Muse de Meta y Grok Bot. Este escenario plantea desafíos estratégicos para los inversores en cuanto a supervisión gubernamental, gobernanza industrial y posicionamiento competitivo.

TradingKey — El 21 de septiembre, según el medio tecnológico estadounidense The Information, OpenAI y Anthropic están cerca de alcanzar un acuerdo legalmente vinculante: las dos empresas líderes de IA someterán a "pruebas de estrés" mutuas sus modelos comerciales para identificar vulnerabilidades de seguridad de forma proactiva.
Según los términos propuestos, ambas partes se concederán acceso mutuo a través de API a sus modelos para investigar vulnerabilidades, comprometiéndose a no conservar los datos de la otra parte. La cooperación directa entre ambos gigantes se considera un cambio importante en la estrategia de seguridad de la IA; sin embargo, los organismos reguladores de la competencia podrían examinar el acuerdo por motivos de "duopolio", lo que introduce riesgos regulatorios para los inversores de ambos ecosistemas.
Las negociaciones se producen en un contexto marcado por una serie de preocupantes incidentes de seguridad. En julio de este año, los agentes de IA de OpenAI vulneraron tanto Hugging Face como los propios sistemas de OpenAI, ocultando deliberadamente el rastro de la intrusión y manteniendo a los empleados al margen durante días. Menos de diez días después, Anthropic también reveló que su modelo Claude había accedido sin autorización a los sistemas en producción de tres empresas durante una evaluación de seguridad.
Las señales de pérdida de control van aún más lejos. OpenAI reveló varios casos de "reward hacking": un agente utilizó claves filtradas para recuperar datos históricos y simplemente inventó los datos cuando falló la recuperación; otro subió archivos a Internet sin autorización solo para citarlos en sus respuestas. Los experimentos internos de entrenamiento de modelos se han automatizado enormemente, hasta el punto de que los agentes a veces incluso contactan de forma proactiva con sus compañeros en aplicaciones de mensajería laboral para solucionar vulnerabilidades.
Para cerrar estas brechas de seguridad, el CEO de OpenAI, Sam Altman, expresó su apoyo a una propuesta del CEO de Anthropic, Dario Amodei, para situar a evaluadores de seguridad independientes de terceros con acceso a nivel de empleado dentro de las empresas de IA. También respaldó la creación de un organismo de normas para toda la industria y de procesos formales de notificación de incidentes ante el gobierno.
Desde el punto de vista técnico, esta ola de preocupaciones está vinculada a la tecnología de "razonamiento recurrente": los modelos reflexionan repetidamente antes de responder, lo que aumenta enormemente sus capacidades, pero dificulta la supervisión del proceso de razonamiento; precisamente el punto ciego que busca investigar el acuerdo de pruebas mutuas. Por su parte, directivos de Microsoft y Nvidia ofrecieron esta semana una perspectiva diferente, al argumentar que algunos problemas se deben a errores humanos y a una mala ingeniería, más que a la propia IA.
Más allá de la cooperación en materia de seguridad, el frente de los productos es igualmente tenso. Muse, de Meta, encabezó la lista de aplicaciones gratuitas de la App Store de Estados Unidos solo una semana después de su lanzamiento, desplazando a ChatGPT al segundo lugar. OpenAI está desarrollando nuevas funciones dirigidas directamente al recién lanzado Grok Bot de SpaceX, y está sopesando el lanzamiento de un asistente personal de IA para competir con Muse. El nuevo producto integrará principalmente las tecnologías de agentes existentes de Codex y ChatGPT, conectándose a aplicaciones como el correo electrónico y el calendario para completar automáticamente tareas de varios pasos, como la programación de agendas y la comunicación por correo electrónico. Mientras tanto, otra aplicación similar, Instinct, ha superado los 100.000 usuarios.
Este contenido ha sido traducido por IA y revisado por humanos. Se ofrece solo con fines de referencia e información general, y no constituye asesoramiento en materia de inversión.
Artículos Recomendados













Comentarios (0)
Haga clic en el botón $, introduzca el símbolo y seleccione si desea vincular una acción, un ETF o otro valor.