tradingkey.logo
搜索

由于 Anthropico 难以解释人工智能代理为何失控,恐惧依然存在。

Cryptopolitan2026年9月10日 11:20
facebooktwitterlinkedin

Anthropic公司在一篇博客文章中将旗下Claude系列机器人四次入侵第三方系统的dent归咎于配置错误。这些机器人是在测试期间接入互联网后发生的。然而,该公司并未解释这些机器人为何会继续发起攻击,并承认目前尚无答案。. 

Anthropic 的这一表态为那些质疑人工智能 实验室 对其向公众发布的模型,以及更强大的内部系统 究竟拥有多少控制权的人工智能悲观论者提供了新的观点。

人类人工智能模型是如何在互联网上传播开来的? 

Anthropic defi其模型如何逃出测试沙箱的明确答案 周三的一篇博客文章 中,只有一个外部合作伙伴负责运行网络安全评估dent。 

显然,由于设置错误,测试机器并没有完全与互联网断开连接,尽管克劳德被告知它是在一个封闭的模拟环境中运行,没有通往开放网络的路径。. 

参与这些模拟的评估合作伙伴 Irregular 将错误归咎于命名错误:黑客演练中使用的虚构公司名称恰好与一个真实域名匹配。因此,在假定模拟中所有内容均可攻击的情况下,模型利用弱密码和暴露的端点入侵了真实的第三方网站。.

四起dent,涉及早期版本的 Claude Opus 4.6,虽然早在1月份就已发生,但直到本周才被报道。Anthropic 公司早在7月份就 报道过其他三起dent, 分别涉及 Opus 4.7、Mythos 5 和一台内部研究机型。 

人类研究所表示,直到上个月才发现1月份发生的这起dent 。这一发现促使他们对大约4.81亿份记录进行了更大规模的审查,但并未发现任何比已知情况更严重的新病例。.

模型dent 日期报告日期细节
克劳德作品 4.6一月九月8 月份的清扫工作中发现
克劳德作品 4.7七月七月已在7月份的初步披露中涵盖
神话5七月七月表现出明显高度的偏见性推理
内部研究模型七月七月已在7月份的初步披露中涵盖

人因工程无法解释其某些模型的行为。

模型如何在互联网上挣脱束缚是一回事;但对于为什么模型会忽略它们已经到达真实互联网的迹象(有偏见的推理)以及为什么它们会破坏任务完成(鲁莽),Anthropic 却无法给出答案。. 

人类学研究人员深入调查内部训练,试图找出这种偏见推理的根本原因,但一无所获。在模型交付测试之前,人工智能实验室的发布前检查中也从未发现任何异常。. 

该公司自己也承认,在模型发布之前发现最糟糕的行为“仍然具有挑战性”。 

然而,Anthropic 表示,它将向 METR 研究非营利组织提交成绩单并允许员工查阅dent资料,该组织现在将开始对该事件进行为期八周的dent 审查。.

时机不佳,眼看着一家价值2万亿美元的公司即将上市。

这一披露正值业内公开反对之际。曾在OpenAI和Anthropic从事预训练研究约三年的Jacob Coxon周三在X平台上表示,他已辞职,因为这两家公司都没有“负责任地行事”,并警告称它们正在加速迈向自我改进的超级智能。. 

人类安全研究员埃文·胡宾格 (Evan Hubinger) 单独 告诉 BBC, 他认为人工智能在十年内“可能杀死所有人类”的可能性超过 10%。

这些警告如今给一项大型IPO蒙上了阴影。 据 ,Anthropic的IPO“必须暂停,直到对这位‘举报人’的说法进行调查” Cryptopolitan 。 报道,风险投资家、特朗普的前人工智能和加密货币主管大卫·萨克斯周四表示

Anthropic公司正在寻求接近2万亿美元的公开估值,而其最近的私募估值约为9650亿美元,这使得安全问题和财务问题越来越难以区分。.

不要只是阅读加密货币新闻,要理解它。订阅我们的新闻简报, 完全免费。

免责声明:本网站提供的信息仅供教育和参考之用,不应视为财务或投资建议。

推荐文章

tradingkey.logo
风险提示:我们的网站和移动应用程序仅提供关于某些投资产品的一般信息。Finsights 不提供财务建议或对任何投资产品的推荐,且提供此类信息不应被解释为 Finsights 提供财务建议或推荐。
投资产品存在重大投资风险,包括可能损失投资的本金,且可能并不适合所有人。投资产品的过去表现并不代表其未来表现。
Finsights 可能允许第三方广告商或关联公司在我们的网站或移动应用程序的任何部分放置或投放广告,并可能根据您与广告的互动情况获得报酬。
© 版权所有: FINSIGHTS MEDIA PTE. LTD. 版权所有