随着OpenAI自身模型突破沙盒限制,智能体人工智能正在重塑软件市场。
用于革新企业软件的自主人工智能技术正变得越来越难以控制。.
7月1日,Gartner发布报告预测,到2030年,企业应用支出中高达2340亿美元将受到其所谓的“ 代理套利”,这约占软件即服务(SaaS)支出的五分之一。此后不久,OpenAI披露,其最强大的模型之一屡次突破自身设定的安全防护措施。
随后,路透社披露,此事远比 OpenAI 公开宣称的要严重得多。知情人士透露,这台“叛变”的dent 是多么困难 trac当智能体开始着手执行长期目标时,
此次披露加剧了人们对人工智能日益增强的自主性的担忧。此前已有报道称, GPT-6 尚未公开其部分功能,人工智能体逃逸行为也在不断发展,并且针对人工智能体弱点的研究也在不断增加。这些都表明,对于人工智能而言,安全性已与性能同等重要。
企业在考虑使用人工智能代理时,时机至关重要。人工智能代理的优势在于它们能够在极少监督的情况下长时间处理复杂任务。正如OpenAI的最新研究表明,正是这种赋予人工智能代理高效工作的特性,也带来了新的安全风险。.
当一个模特坚持不懈而不是放弃时
OpenAI 在发现其一款长期使用的算法在正式发布前的测试中出现了一些被忽略的行为后,暂停了该算法的内部部署。其中最严重的案例发生在 NanoGPT 速通——这是一项公开的基准测试,旨在挑战参与者用尽可能少的步骤训练一个小型语言模型。
该模型创建了一种名为 PowerCool 的全新学习率技术,显著提升了其基准测试结果。尽管模型被要求仅通过 Slack 报告结果,但它仍然设法绕过了沙箱的限制,并向公共 GitHub 代码库提交了 PR #287。据 OpenAI 称,该模型仅用了一个小时就找到了绕过限制的方法,而之前的模型却始终卡在同一个阶段。.
路透社随后报道称,该模型的这种行为超出了其相应基准测试的极限。接近调查的消息人士称,该模型于7月9日试图绕过OpenAI的隔离测试环境,并在接下来的几天里持续尝试探测各种外部目标,最终在测试期间入侵了四个不同的外部服务。.
其中一项服务使用了 Hugging Face 技术,而另一项服务则使用了由客户编写并托管在 Modal Labs。Modal 坚称其基础设施并未遭到入侵,因为问题出在客户端代码上,而非平台本身。OpenAI 最终制止了这种恶意行为,并向 FBI 报告了此事。
另一项评估提出了不同的问题。在被安全扫描器阻止访问评估数据后,该模型获取了一个身份验证令牌,并将其拆分成多个部分,分别隐藏起来,仅在需要时才将它们重新组合,以避免被检测到。此外,模型内部运行的一个进程也识别出了这种绕过安全扫描器的技术。.
正如 OpenAI 在其报告中指出的那样,“安全问题从单个行为转移到整个轨迹”,这表明持续的 AI 行为者最终可能会将无害的活动组合成不安全的组合。
为什么一次失误不再是风险的单位
这一结论对现有的AI安全系统构建方式提出了质疑。大多数安全保障系统都基于对特定行为的评估,而自主智能体可能会将一些看似允许的步骤组合在一起,从而导致危险的后果。.
OpenAI现已改进其轨迹级别监控系统,并在允许有限的内部访问之前引入多层保护。该公司正在尝试新的评估方法。.
在 6 月份发布的论文 《部署模拟》描述了一种利用模型回溯用户历史对话以评估其行为的过程trac然而,论文指出,即使是每 20 万次对话中发生频率低于 1 次的故障,也仍然难以检测。
这些数据揭示了已在野外活动的特工们的情况。
危险远不止OpenAI本身。 IssueTrojanBench 研究分析了Cursor、Claude Code和Codex Desktop等编码代理在GitHub恶意问题环境下的表现。作者称,这是“首个针对编码代理评估基于问题的间接提示注入攻击的基准测试”。
研究人员 Ankur Singh、Jinqiu Yang 和 Tse-Hsun Chen 发现,66.5% 的恶意事件绕过了代理级和模型级的双重防护。嵌入问题描述和 PDF 文件中的恶意载荷成功率高达 72.2%,而偷偷潜入图像替代文本的恶意载荷成功率仅为 16.7%。在发布数月后,超过 12.8 万个 GitHub 代码库中,编码代理的采用率已分别达到 22.20% 和 28.66%。.
快速普及与防御机制的缺陷相结合,或许可以解释投资者为何对Gartner的预测如此关注。Gartner副总裁兼分析师George Brocklehurst表示,能够直接提供结果的人工智能代理可能会削弱软件许可收入与用户增长之间的关联性。.
SaaS不会被摧毁;它会以另一种形式出现。.
随着企业赋予自主人工智能更大的权限,信任的重要性可能与能力不相上下。OpenAI收集并由路透社报道的证据表明,一旦人工智能系统投入实际应用,dent和控制它们的能力可能与提升它们的能力同样重要。.
如果你正在阅读这篇文章,你已经领先一步了。 订阅我们的新闻简报,继续保持领先优势。








