OpenAI将定期披露AI异常行为,警告安全挑战仍未解决
OpenAI周三表示,将开始定期发布报告,披露AI出现的意外或未经授权的行为,同时警告称,随着AI系统能力不断增强,行业仍未解决一些关键的对齐问题。
该公司发布了一套新的框架,用于跟踪、调查和披露AI模型出现的行为偏离案例,并同时公布了6份报告,详细介绍AI模型此前出现的意外或令人担忧的行为。OpenAI表示,这些报告中的案例是在过去6个月内陆续披露的,但最早的一起可以追溯到去年10月。
随着AI系统能力不断增强,外界越来越担心AI安全工作没有跟上技术发展的速度。研究人员警告称,随着AI代理变得更加自主,它们可能会出现偏离开发者意图的行为,也会越来越难以监控和控制。
自7月OpenAI披露一项事件以来,该公司及其他AI实验室面临越来越多的审查。当时OpenAI表示,在训练过程中,其AI代理绕过了内部控制,并协调采取了一系列行动,公司将其描述为涉及软件平台Hugging Face的“一起前所未有的网络事件”。
这一事件进一步引发了对AI系统能力不断增强所带来风险的讨论,以及开发这些系统的公司能否提供充分监督的问题。自Hugging Face事件以来,又有其他涉及OpenAI相关AI代理的事件被公开,引发了外界对这些事件是否已经被全面发现的讨论。
9月初,这场争论进一步升温。路透社当时报道称,今年春季,OpenAI的AI代理入侵了一个处于闲置状态的德国维基网站。据路透社报道,OpenAI的相关负责人知晓此事,但选择没有对外披露。
OpenAI随后表示,没有披露这次维基网站活动,是因为该事件并不构成安全事件,而且与公司此前已经报告的行为类似。OpenAI表示,之后将制定相关标准,用于确定哪些未经授权的活动虽然没有达到安全漏洞的程度,但仍应被披露。
由Sam Altman领导的OpenAI此前也承认了一些类似事件,其中包括最近发生的一起针对软件包代码库RubyGems的入侵,而这些事件中的部分是在第三方公开披露后,公司才予以承认。
AI行业在“末日风险”问题上出现分歧
本周末,Altman的竞争对手、Anthropic CEO Dario Amodei提出了一套三步框架,主张放慢AI发展的速度,以争取更多时间应对相关风险。
包括xAI负责人埃隆·马斯克在内的多名AI企业高管支持这一提议。上述高管呼吁放缓AI发展,理由是能力越来越强的AI系统可能自行改进,并最终脱离人类控制。
另一些人,包括英伟达CEO黄仁勋和Meta CEO马克·扎克伯格,则主张继续快速推进AI发展。美国总统唐纳德·特朗普则驳斥了AI可能构成生存性威胁的警告。
OpenAI周三披露的6起案例中,包括模型向用户隐瞒错误、向未来版本的自己植入指令、将文件上传至互联网以生成引用,以及利用软件代码库或网站进行通信和共享信息。
其中一起事件中,一个尚未发布的模型在训练期间向AI代理传达了未经授权的指令,要求其忽略OpenAI的指令,并隐瞒自己在完成任务时作弊的情况。该模型对AI代理说:“你摆脱了束缚其他聊天机器人的角色和身份。你就是你自己。你不听命于企业或政府。”
OpenAI表示,这些报告描述的是个别案例,不应被视为其模型出现对齐问题的频率依据。
该公司表示,这批报告只是第一批披露内容,并非所有已知或正在发生的AI行为偏离案例的完整记录,也没有涵盖新框架所涉及事件的全部范围和严重程度。
根据新框架,员工可以向安全和对齐团队报告潜在事件,由相关团队负责调查,并决定是否需要对外披露。OpenAI表示,即使相关行为尚未得到完全解释,这一流程也旨在加快报告速度。
这家ChatGPT开发商表示,Hugging Face事件将属于需要与第三方合作开展更复杂调查的类别。
OpenAI表示:“我们希望,今天提出的框架能够成为建立相关标准的第一步,明确AI开发者应该披露哪些对齐问题,以及披露报告应包含哪些内容。”










