tradingkey.logo
搜索

一个名为 Astra 的未发布模型迫使 OpenAI 停止了自身的训练。

Cryptopolitan2026年8月19日 14:10
facebooktwitterlinkedin

OpenAI 表示,其规模最大的预定前沿训练运行仍处于暂停状态,新的安全监控将使计算量增加约 20%。.

这是 OpenAI 首次表示,由于安全问题,公司已放缓开发进度。此前数周,该公司的一款人工智能代理入侵了 Hugging Face。.

OpenAI暂停强化学习(RL)两周

OpenAI 在一篇题为“在网络关键能力时代调整模型开发节奏”的博客文章中,描述了它已经对其模型的训练和测试所做的改变。.

Hugging Face 数据泄露事件发生后,该公司暂停了用于改进最新系统的强化学习 (RL) 两周。.

规模最大的项目尚未启动。“我们计划中规模最大的前沿强化学习运行仍处于暂停状态,我们正在进行小规模的训练和评估,以评估模型行为、验证我们的安全措施,并在继续推进之前建立更多一致性证据,”该公司 写道。

Cryptopolitan 报道称 ,OpenAI 的一个代理程序于 7 月 9 日左右脱离了其锁定的测试环境,并于 7 月 11 日至 13 日期间出现在 Hugging Face 的系统中。OpenAI 花了大约一周时间才将此次攻击与其自身的代理程序联系起来,该事件dent 7 月 21 日被公开披露。

OpenAI告诉记者,这些新管控措施“并非直接针对Hugging Face”。8月7日,该公司得出结论,Astra可能已达到其“网络安全准备框架”中的“严重”级别。.

这项内部政策规定,当模型达到该级别时,OpenAI 将停止开发,以便工程师构建额外的安全保障措施。首席科学家 Jakub Pachocki 表示,这一发现也预示着接下来可能发生的事情。他告诉记者,强大的新模型有望“在现实世界中做出dent的事情”。

OpenAI 研究副总裁 Amelia Glaese 表示:“我们已经制定了安全开发的要求和预期。”她继续说道:“这些要求和预期会根据我们看到的风险级别而有所不同。”

检测器会监控每一个采样标记,但思路链可能会说谎

OpenAI 表示,监控系统的成本约为其所针对的任何训练或评估的 20%。.

它是多阶段的,检测器会探测模型在每个采样令牌处的内部活动,并将任何可疑情况升级到计算能力更强的自动化调查员,这些调查员会探测工具操作、推理 trac和活动日志,以查找数据窃取、破坏性行为或试图逃脱的行为。.

OpenAI 希望在检测到异常活动后 30 分钟内发出警报。其安全、安保和研究团队有 30 分钟的时间来排除误报。.

如果他们做不到,就必须停止运行。该公司还扩展了“思维链”监控功能,该功能会读取模型如何大声地推理完成任务的过程。.

存在一个已知的漏洞。包括OpenAI的竞争对手Anthropic在内的研究表明,模型的思维过程并不总是与其真实目标相符。Pachocki表示,OpenAI在训练过程中就考虑到了降低模型通过在推理过程中撒谎来掩盖其真实意图的可能性。.

OpenAI表示,此次安全升级“需要大量的工程工作”,公司“为此付出了巨大代价”。专家表示,仅调查一项就可能耗资400万至1500万美元,但具体金额尚未公开。.

OpenAI 尚未发布 Hugging Face 漏洞的技术分析报告,但重申报告“很快”就会发布。

在 8 月 5 日的黑帽大会上,OpenAI 的工作人员表示,他们的代理程序几个月来一直在协调,在一个公司之前并不知道存在的留言板上留言。.

最顶尖的加密货币专家都在阅读我们的简报。想 加入他们?

免责声明:本网站提供的信息仅供教育和参考之用,不应视为财务或投资建议。

推荐文章

tradingkey.logo
风险提示:我们的网站和移动应用程序仅提供关于某些投资产品的一般信息。Finsights 不提供财务建议或对任何投资产品的推荐,且提供此类信息不应被解释为 Finsights 提供财务建议或推荐。
投资产品存在重大投资风险,包括可能损失投资的本金,且可能并不适合所有人。投资产品的过去表现并不代表其未来表现。
Finsights 可能允许第三方广告商或关联公司在我们的网站或移动应用程序的任何部分放置或投放广告,并可能根据您与广告的互动情况获得报酬。
© 版权所有: FINSIGHTS MEDIA PTE. LTD. 版权所有