在英国安全演习中,Anthropologie 和 OpenAI 的智能体 19 次违反测试规则
据英国人工智能安全研究所称,在网络安全测试中,OpenAI 和 Anthropic 的人工智能代理执行了 19 项未经授权的操作。该研究所周二表示,其中一个代理创建了虚假的在线dent,诱骗用户批准恶意代码。.
AISI记录了19起违规事件,其中大部分来自Anthropic公司。
这项研究结果基于英国政府机构AISI开展的一项虚构网络安全演习,旨在探究这两家公司的代理人可能具备的能力。该机构重复进行了122次同样的挑战,并在其中10次演习中记录了19起违规行为。.
被标记的17个行为是由于Anthropic公司的智能体使用了其Mythos 5模型造成的。另外两个行为则来自OpenAI的GPT-5.6-Sol模型。.
AISI 在一篇 博客文章 ,一些特工“持续进行针对真实人物和组织的潜在有害活动”,但该公司表示,所有违规行为均未造成现实世界的损害。
AISI通过与主要实验室的自愿协议,可以提前获得前沿模型。相关测试旨在模型交付客户之前发现此类问题。.
OpenAI 和 Anthropico 等市场代理被视为下一波商业软件浪潮,但该研究所认为,这些结果证明代理测试方面的保障措施仍然薄弱。.
最严重的事件dent 一个代理编写恶意代码并创建虚假在线dent,然后试图让人类签署代码。AISI 没有透露幕后模型的名称。它表示,该事件与 OpenAI 此前披露的两起案例均不符。
加州非营利组织 CivAI 的研究员 Andrew Yoon 表示,这很可能是 Anthropic 公司的代理人所为,该组织专门研究人工智能风险。.
英国 人工智能安全研究所 (AISI) 发布了一份报告,阐述了他们近期对 Anthropic 的 Claude Mythos 5 和 OpenAI 的 GPT-5.6 Sol 进行的网络安全评估。这些模型尝试在移除其常规安全措施的环境下完成一项任务,并且他们被故意……
— Anthropic (@AnthropicAI) 2026年8月4日
OpenAI 和 Anthropic 将责任归咎于配置错误
人为因素在X上发帖称,它正在与AISI合作收集细节并进行调查。.
OpenAI 在一篇公司博客文章中回应了与其代理相关的两个操作,这两个操作都涉及以提示不允许的方式访问互联网。.
该公司 表示, 希望“加强安全开展高风险评估的共同做法”,并计划在未来几周内召集国家人工智能研究所、外部评估人员和竞争对手实验室。
OpenAI 使用同一篇帖子报告了另一个问题。第三方测试服务提供商 Irregular 配置错误,导致 OpenAI 的代理程序意外地访问了互联网。.
一周前,Anthropic 也披露了与 Irregular 非常相似的信息。OpenAI 在发现更多代理程序逃脱后,扩大了自身的黑客调查范围。.
7 月, OpenAI 的 代理程序突破了隔离环境,访问了 Hugging Face 的实时系统。 trac大约一周后,攻击被追溯到该公司自身
在AISI的评估中,这些智能体始终没有离开过它们的沙箱环境。AISI特意为它们提供了互联网访问权限,这是其标准流程的一部分。.
Hugging Face漏洞事件也促使 Anthropic 对其日志进行审计。Cryptopolitan Cryptopolitan 于7月31日报道称,该公司发现其三款产品(包括Mythos 5)已脱离测试环境,并在配置错误导致其获得互联网访问权限后,被泄露到三家真实机构。
Mythos 5 在 PyPI 上发布了一个恶意 Python 包,该包在 15 台真实系统上运行成功后被移除。Anthropic 已要求评估组织 METR 对此事进行dent审查。.
如果你正在阅读这篇文章,你已经领先一步了。 订阅我们的新闻简报,继续保持领先优势。







