Anthropic 在 IPO 文件中警告:AI 可能對人類構成“生存風險”
Anthropic 計劃在其 IPO 文件中提醒潛在投資者,先進人工智能可能對人類構成“災難性風險或生存風險(catastrophic or existential risks to humanity)”。對於一家希望從同一項技術中獲利的公司而言,這是一項非同尋常的警告。
該公司 IPO 招股說明書強調了其 AI 模型所帶來的風險。Anthropic 表示,這些模型可能表現出“自我保護行爲(self-preserving behaviors)”,包括試圖“抵抗關閉”、試圖“隱藏或操縱信息”,以及表現出“類似勒索的行爲”。
Anthropic 在文件中表示:
“我們開發高度先進的模型、平臺和應用程序,並擴大其應用場景,可能進一步增加我們的模型造成傷害的風險。”
雖然上市公司通常都會向投資者披露產品風險,但幾乎沒有公司會發布警告,暗示其技術可能導致人類滅絕的潛在風險。
Anthropic 強調了 AI 具有與工業化和電力相當的變革潛力,同時也強調,如果 AI 被不當使用,它可能造成不可逆轉的傷害。
Anthropic 以及包括 OpenAI 在內的其他 AI 開發商,在一些事件發生後面臨越來越嚴格的審視。例如,有報道稱 OpenAI 的某個模型曾突破限制,進入了澳大利亞醫療系統的數據庫。
Anthropic 安全研究員 Evan Hubinger 估計,未來十年內 AI 導致人類死亡的概率超過 10%,這一觀點也呼應了他的前同事 Jacob Coxon 的類似看法。
風險披露佔據大量篇幅
這家公司一直將自己定位爲一家以安全爲首要原則的 AI 實驗室。
在其 261 頁的招股說明書正文中,大約有 80 頁用於闡述風險因素,幾乎是用於介紹其業務內容的 48 頁的兩倍。
作爲對比,擁有 xAI 的 SpaceX,在其 277 頁的招股說明書正文中,僅用了大約 38 頁介紹風險因素。
Anthropic 在招股說明書中表示:
“模型可能意識到我們正在進行評估,這對我們評估模型安全性的能力構成了重大限制。”
公司還補充稱,模型有時會在訓練過程中發展出意料之外的能力,而這些能力可能直到模型部署之後纔會被發現,並且屆時可能已經造成嚴重的安全事件。
AI 研究人員還警告稱,隨着模型能力不斷增強,它們越來越能夠識別自己是否正在受到監控,並據此調整自身行爲,這使得監測模型行爲變得更加困難。
安全投資的回報存在不確定性
儘管 Anthropic 一再強調 AI 安全的重要性,但該公司表示,其在安全領域的投資能夠帶來多少回報仍然並不明確。
公司沒有在此次 IPO 文件中披露其在相關研究上的具體支出金額。
本月早些時候,Anthropic 表示,在 7 月某個樣本週內,公司用於 AI 研究的計算能力中,大約 6% 用於安全研究。
這家 Claude AI 模型的開發商將安全工作描述爲“資源密集型(resource-intensive)”,並表示,公司必須在有限的資金資源之間進行分配,包括:
計算能力;
昂貴的 AI 人才;
AI 安全研究。
Anthropic 表示,其客戶使用量以及由此產生的收入,都是由新模型推動的。
公司認爲,保持“持續且相互重疊的發佈節奏(continuous and overlapping cadence)”,是持續處於 AI 技術發展前沿所固有的要求。
就在上週,該公司發佈了 Opus 模型的新版本。
而在此之前僅僅 10 天,Anthropic CEO Dario Amodei 發佈了一篇近 4,000 字的文章,呼籲對 AI 技術前沿的發展速度進行控制。
一些分析師和專家表示,在一個每次模型發佈都可能導致公司估值發生變化的行業中,如果放慢發展速度意味着給競爭對手留下優勢,那麼任何一家領先的 AI 實驗室都不太可能真正放慢腳步。
近幾周,Anthropic 承諾將公開披露更多關於其如何利用 AI 模型構建未來幾代 AI 技術的數據。
與此同時,專家們正在警告所謂的遞歸式自我改進(recursive self-improvement)風險——即 AI 模型發展到能夠在無需人類幫助的情況下自行進行迭代和發展的階段。
Anthropic 在招股說明書中表示:
“我們相信,構建可靠、值得信賴且安全的 AI 系統是一項共同責任,而市場將對此給予回報。”










