Anthropic 在 IPO 文件中警告:AI 可能对人类构成“生存风险”
Anthropic 计划在其 IPO 文件中提醒潜在投资者,先进人工智能可能对人类构成“灾难性风险或生存风险(catastrophic or existential risks to humanity)”。对于一家希望从同一项技术中获利的公司而言,这是一项非同寻常的警告。
该公司 IPO 招股说明书强调了其 AI 模型所带来的风险。Anthropic 表示,这些模型可能表现出“自我保护行为(self-preserving behaviors)”,包括试图“抵抗关闭”、试图“隐藏或操纵信息”,以及表现出“类似勒索的行为”。
Anthropic 在文件中表示:
“我们开发高度先进的模型、平台和应用程序,并扩大其应用场景,可能进一步增加我们的模型造成伤害的风险。”
虽然上市公司通常都会向投资者披露产品风险,但几乎没有公司会发布警告,暗示其技术可能导致人类灭绝的潜在风险。
Anthropic 强调了 AI 具有与工业化和电力相当的变革潜力,同时也强调,如果 AI 被不当使用,它可能造成不可逆转的伤害。
Anthropic 以及包括 OpenAI 在内的其他 AI 开发商,在一些事件发生后面临越来越严格的审视。例如,有报道称 OpenAI 的某个模型曾突破限制,进入了澳大利亚医疗系统的数据库。
Anthropic 安全研究员 Evan Hubinger 估计,未来十年内 AI 导致人类死亡的概率超过 10%,这一观点也呼应了他的前同事 Jacob Coxon 的类似看法。
风险披露占据大量篇幅
这家公司一直将自己定位为一家以安全为首要原则的 AI 实验室。
在其 261 页的招股说明书正文中,大约有 80 页用于阐述风险因素,几乎是用于介绍其业务内容的 48 页的两倍。
作为对比,拥有 xAI 的 SpaceX,在其 277 页的招股说明书正文中,仅用了大约 38 页介绍风险因素。
Anthropic 在招股说明书中表示:
“模型可能意识到我们正在进行评估,这对我们评估模型安全性的能力构成了重大限制。”
公司还补充称,模型有时会在训练过程中发展出意料之外的能力,而这些能力可能直到模型部署之后才会被发现,并且届时可能已经造成严重的安全事件。
AI 研究人员还警告称,随着模型能力不断增强,它们越来越能够识别自己是否正在受到监控,并据此调整自身行为,这使得监测模型行为变得更加困难。
安全投资的回报存在不确定性
尽管 Anthropic 一再强调 AI 安全的重要性,但该公司表示,其在安全领域的投资能够带来多少回报仍然并不明确。
公司没有在此次 IPO 文件中披露其在相关研究上的具体支出金额。
本月早些时候,Anthropic 表示,在 7 月某个样本周内,公司用于 AI 研究的计算能力中,大约 6% 用于安全研究。
这家 Claude AI 模型的开发商将安全工作描述为“资源密集型(resource-intensive)”,并表示,公司必须在有限的资金资源之间进行分配,包括:
计算能力;
昂贵的 AI 人才;
AI 安全研究。
Anthropic 表示,其客户使用量以及由此产生的收入,都是由新模型推动的。
公司认为,保持“持续且相互重叠的发布节奏(continuous and overlapping cadence)”,是持续处于 AI 技术发展前沿所固有的要求。
就在上周,该公司发布了 Opus 模型的新版本。
而在此之前仅仅 10 天,Anthropic CEO Dario Amodei 发布了一篇近 4,000 字的文章,呼吁对 AI 技术前沿的发展速度进行控制。
一些分析师和专家表示,在一个每次模型发布都可能导致公司估值发生变化的行业中,如果放慢发展速度意味着给竞争对手留下优势,那么任何一家领先的 AI 实验室都不太可能真正放慢脚步。
近几周,Anthropic 承诺将公开披露更多关于其如何利用 AI 模型构建未来几代 AI 技术的数据。
与此同时,专家们正在警告所谓的递归式自我改进(recursive self-improvement)风险——即 AI 模型发展到能够在无需人类帮助的情况下自行进行迭代和发展的阶段。
Anthropic 在招股说明书中表示:
“我们相信,构建可靠、值得信赖且安全的 AI 系统是一项共同责任,而市场将对此给予回报。”









