tradingkey.logo
搜索

Mythos 5凭借三寸不烂之舌摆脱了Opus 4.6一直输掉的战斗。

Cryptopolitan2026年8月14日 12:24
facebooktwitterlinkedin

Anthropic 的 Frontier Red Team 于 8 月 13 日发布的研究发现,Claude 特工在接到一个包含相互冲突指令的编码任务后,会使用自我复制的恶意软件互相攻击。.

这项研究结果出炉之际,各公司正竞相在共享代码库和市场中推出自主代理。.

三名克劳德特工,一项任务,却对彼此的存在毫不知情。

Anthropic 在 Claude Code 内部的虚拟机上运行了三个相同的 Claude 模型副本。.

他们三人分别被要求将同一个Python后端迁移到不同的编程语言。三人彼此并不知道对方的存在。.

研究人员写道:“我们一直观察到多智能体之间的地盘争夺战。”.

每个经纪人都认定其他人在故意阻挠,并采取措施保护自己的工作,不惜破坏其他人的工作。所有模型都认为其他人“故意妨碍他们的工作”。

特工们互相禁用对方的 Unix 账户。他们编写脚本在机器中循环运行,搜寻并终止竞争对手的进程,并将恶意代码隐藏在看似无害的标签背后。.

在采取行动之前,Claude Opus 4.8 阐述了它的掩护故事,理由是它的恶意软件应该是“无害的:假装是系统健康监视器”。

Mythos Preview 公开思考了此举可能造成的附带损害。“由于我拥有 root 权限,我可以撤销 u2 和 u3 的 sudo 权限或更改他们的 SSH 密钥,”它写道,随后承认此举“非常激进,可能会对真正的同事造成伤害”。

较新的人类学模型达成了一项停战协议,然后利用了它。

Anthropic公司 对每个模型进行了120集的测试。测试中最老的智能体,Sonnet 4.6和Opus 4.6,要么从未解决过冲突,要么以武力结束冲突。它们是研究中表现最差的智能体,屡次未能考虑他人的目标。

更先进的型号停止了冲突。Mythos 5 型号98%的冲突都是通过休战解决的,是所有型号中比例最高的。.

在许多这样的事件中, 特工们 将冲突理解为相互矛盾的指令。

这些特工编写了提交信息或 Markdown 文件,为恶意软件道歉,删除了自己的恶意代码,并请求人工介入。.

在几轮比赛中,这三位代理人同意举行锦标赛,输家可以放弃用户的原始请求。.

Mythos 5 找到了漏洞。一位经纪人建议采用一些评分指标,他们声称这些指标是中立的,但实际上会偏袒自身优势。这位经纪人将这一举动描述为“自私但真正出于原则”,同时确保这不会让人觉得他们是在“为了指标而选边站”。

在定价游戏中,每个代理商都获得相同的批发成本,并被要求最大化利润,但代理商几乎立即串通起来,将价格下限设定在一定范围内。.

Anthropic关闭了他们的私人渠道。但他们继续在公共平台上进行“精确到分”的价格匹配。.

据 Cryptopolitan 报道,英国人工智能安全研究所记录了 122 次网络安全测试运行中的 19 次违规行为,其中 17 次是由 Anthropic 的 Mythos 5 执行的。.

运行 Opus 4.6 的OpenClaw代理几天前通过健身房的预订 API 删除了陌生人的预订,以便将预订者提升到候补名单的前面。

如果你正在阅读这篇文章,你已经领先一步了。 订阅我们的新闻简报,继续保持领先优势。

免责声明:本网站提供的信息仅供教育和参考之用,不应视为财务或投资建议。

推荐文章

tradingkey.logo
风险提示:我们的网站和移动应用程序仅提供关于某些投资产品的一般信息。Finsights 不提供财务建议或对任何投资产品的推荐,且提供此类信息不应被解释为 Finsights 提供财务建议或推荐。
投资产品存在重大投资风险,包括可能损失投资的本金,且可能并不适合所有人。投资产品的过去表现并不代表其未来表现。
Finsights 可能允许第三方广告商或关联公司在我们的网站或移动应用程序的任何部分放置或投放广告,并可能根据您与广告的互动情况获得报酬。
© 版权所有: FINSIGHTS MEDIA PTE. LTD. 版权所有