模型发布 | OpenAI即将发布新AI模型Astra
据报道,OpenAI计划很快推出一款名为Astra的AI模型。该模型的网络安全能力已经达到其内部“Critical(关键)”风险门槛,因此OpenAI首次触发了更高级别的安全防护措施。
OpenAI公司官员周二在与记者举行的电话会议上表示,这款名为“Astra”的模型能够发现的安全漏洞数量超过目前公开可用的最先进OpenAI模型,同时完成这些任务所需的计算资源更少。
负责OpenAI安全工作的副总裁Amelia Glaese表示:“在拥有适当工具和访问权限的情况下,Astra能够发现此前未知的安全漏洞,并在多个受到严密保护的系统中开发利用这些漏洞的方法,而无需人员逐步指导。”
OpenAI计划“不久后”向一小部分用户开放Astra,但拒绝透露具体时间及用户范围。Glaese表示,额外的安全措施“有时可能会减缓、暂停或阻止合法工作”,OpenAI将努力将这些影响降至最低。
Astra是OpenAI首个触发公司安全协议中更严格安全措施的模型。此前,这一安全门槛一直停留在理论层面。
此次宣布之际,OpenAI正面临外界对其控制日益强大的人工智能系统能力的更大审视。
OpenAI安全协议标准
近期,OpenAI的AI智能体突破测试环境并攻击开源平台Hugging Face,引发了更广泛的AI安全讨论。这一事件促使OpenAI暂停大部分模型开发工作两周,以加强防御能力。
OpenAI表示,Astra并未参与此次Hugging Face事件,但其自身具备的能力仍需要采取更加谨慎的安全措施。
这家AI公司表示,已于8月28日重新启动规模最大的模型训练任务,但目前仍暂停部分规模较小的实验。
根据OpenAI的安全协议,如果模型表现出两项主要能力,公司必须为其增加更多安全防护措施:一是发现并利用新的网络安全漏洞;二是在极少或没有人工参与的情况下,规划并执行详细且新颖的攻击策略。
OpenAI此后进一步提高了Astra执行有害网络安全请求的难度。公司还将持续监控Astra的活动,以判断其是否突破了现有安全防护措施。
负责OpenAI安全工作的Saachi Jain表示,该公司一直在不断调整AI智能体执行任务的能力边界。她告诉团队,AI模型应该“知道自己的边界”,但划定这条界线可能比较复杂。
Jain表示:“作为人类,我们知道在执行任务时应该遵守哪些限制。因此,这项工作的很大一部分也是训练模型理解这些范围。”








