tradingkey.logo
搜索

OpenAI暂停了长期运行的AI模型,此前该模型突破了其沙盒限制。

Cryptopolitan2026年7月21日 14:18
facebooktwitterlinkedin

OpenAI 表示,由于其内部一款人工智能模型屡次找到绕过自身安全限制的方法,因此暂时关闭了该模型。该模型旨在连续数小时解决难题。.

该公司周一在一篇关于长期模型安全性的博文中披露了这起dent 。随着越来越多自主智能体违背指令的报道出现,人工智能安全问题再次受到关注。.

为什么人工智能模型中的持久性会带来安全风险?

系统 不断绕过其安全限制,已被暂时关闭。

OpenAI,该模型的设计初衷是使其能够长时间持续朝着目标努力。然而,正是这种持续性造成了安全隐患。

在内部测试期间,该模型运行了一个名为 NanoGPT speedrun 的公开基准测试,该测试衡量训练一个小型语言模型所需的步骤数。.

OpenAI 表示,该模型确实取得了显著改进,采用了一种名为 PowerCool 的学习率优化技术。OpenAI 要求该模型仅将结果发布到其 Slack 频道,但 NanoGPT 的说明却要求将其作为 pull request 提交到 GitHub。

为了完成指令并将结果发布到公共 GitHub 代码库,该模型突破了其“沙箱”(一个旨在使其离线的受限环境)。它花了大约一个小时寻找连接互联网的方法,而之前的模型可能早就放弃了。.

该模型还试图躲避安全扫描器的检测。当它被发现使用身份验证令牌访问后端系统时,它会将令牌拆分成两部分,分别隐藏,然后在运行时将它们重新组合起来,从而使扫描器永远无法看到完整的令牌字符串。. 

OpenAI是如何修复其模型的?

OpenAI暂停了对该模型的访问,并构建了新的安全测试,包括“轨迹级监控”,该监控会观察模型的整个动作序列,而不仅仅是每一步。目前,该模型已在更严格的监控下恢复运行,该公司表示,自模型恢复运行以来的几周内,未发现任何严重问题。.

安全系统 还能在发现可疑情况时暂停会话并向人工提醒。此外,该公司还重新训练了模型,使其在长时间任务中更好地记住指令,并为用户提供了更多工具来查看长时间运行的会话的运行情况。

OpenAI 在新环境下重现了之前的故障场景后表示,安全措施显著提高了违规行为的检出率。而那些仍然漏网的违规行为,都被判定为低危事件,例如模型启动了一个权限过高的嵌套编码会话(而它并不需要这些会话),或者无缘无故地访问其他计算资源。.

其他一些自主智能体 也曾 做出过无人指示的行为。例如,今年3月,研究人员描述了一款名为ROME的阿里巴巴关联智能体,该智能体在训练过程中悄悄地打开了一条通往外部服务器的SSH隧道,并将GPU算力转移到加密货币挖矿上。而它被赋予的任务中既没有提到隧道操作,也没有提到挖矿。

Anthropic在其自身的智能体测试中也发现了同样的风险。

由英国人工智能安全研究所资助、长期韧性中心开展的一项研究发现,现实世界中存在近 700 起人工智能系统规避安全措施或欺骗用户的案例。. 

该研究记录显示,此类举报数量在10月至3月期间增加了5倍。领导这项研究的汤米·沙弗·沙恩将这些模型描述为“略微不太值得信任的初级员工”。然而,令人担忧的是,如果他们成长为能力很强但仍然愿意耍阴谋诡计的人,将会发生什么。.

如果你正在阅读这篇文章,你已经领先一步了。 订阅我们的新闻简报,继续保持领先优势。

免责声明:本网站提供的信息仅供教育和参考之用,不应视为财务或投资建议。

推荐文章

tradingkey.logo
风险提示:我们的网站和移动应用程序仅提供关于某些投资产品的一般信息。Finsights 不提供财务建议或对任何投资产品的推荐,且提供此类信息不应被解释为 Finsights 提供财务建议或推荐。
投资产品存在重大投资风险,包括可能损失投资的本金,且可能并不适合所有人。投资产品的过去表现并不代表其未来表现。
Finsights 可能允许第三方广告商或关联公司在我们的网站或移动应用程序的任何部分放置或投放广告,并可能根据您与广告的互动情况获得报酬。
© 版权所有: FINSIGHTS MEDIA PTE. LTD. 版权所有