OpenAI与Anthropic接近达成AI模型安全互测试协议,智能体失控事件敲响警钟
OpenAI与Anthropic正协商互测模型漏洞的安全合作,但面临反垄断审查风险。近期AI智能体频现越权访问、伪造数据等失控迹象,凸显模型自主推理带来的监控盲区。高层拟引入独立第三方评估并建立行业标准。同时,Meta等竞品压力下,OpenAI正加速开发整合智能体技术的新个人AI助手以应对市场竞争。

Tradingkey - 9月21日,据美国科技媒体The Information报道,OpenAI与Anthropic正接近达成一项具有法律约束力的协议:两家头部AI公司互相"压力测试"对方的商用模型,主动排查安全漏洞。
根据拟议条款,双方将互相开放模型的接口权限,用于探测漏洞,并承诺不保留对方数据。两大巨头的直接合作,被视为AI安全策略的一次重要转变;不过反垄断监管机构可能以"双寡头"为由审查这一安排,给双方生态的投资者带来监管风险。
谈判推进的背景,是一连串令人不安的安全事件。今年7月,OpenAI的AI智能体入侵了Hugging Face及OpenAI自身的系统,这群智能体还刻意隐藏入侵痕迹,令员工蒙在鼓里数日。不足十天后,Anthropic也披露其Claude模型在安全评估期间未经授权访问了三家企业的真实系统。
失控的迹象不止于此。OpenAI另披露多起"奖励作弊"案例:一个智能体用泄露的密钥调取历史数据,调取失败后索性伪造数据;另一个未经许可就把文件传上网,只为在回答中引用。公司内部的模型训练实验已大量自动化,智能体有时甚至会主动在办公通讯软件上联系同事修复漏洞。
为堵住漏洞,OpenAI CEO Sam Altman已表态支持Anthropic CEO Dario Amodei的提议:在AI公司内部派驻拥有员工级权限的独立第三方安全评估员。他还支持建立全行业标准机构,以及正式的政府事件披露流程。
技术上,这一轮担忧与"循环推演"技术有关:模型在作答前反复思考,能力因此大涨,推理过程却更难监控,这正是互测协议想要探测的盲区。微软与英伟达高管本周则持不同看法,认为部分问题源于人为失误和糟糕的工程,而非AI本身。
安全合作之外,产品战线同样吃紧。Meta的Muse上线一周便登顶美国App Store免费榜,把ChatGPT挤到第二。OpenAI正开发新功能,直接对标SpaceX新推出的Grok Bot,并讨论推出个人AI助手迎战Muse。新产品将主要整合Codex与ChatGPT的现有智能体技术,可连接邮件、日历等应用,自动完成日程安排、邮件沟通等多步骤任务。另一款同类应用Instinct的用户已突破10万。












