Kimi K3 在網絡攻擊規劃方面表現遜於美國前沿人工智能模型
一份聯合評估報告指出,在構建軟件漏洞利用程序和運行模擬網絡攻擊方面,Moonshot AI 的 Kimi K3 還達不到美國tron的 AI 系統水平。.
英國人工智能安全研究所 (AISI) 和美國人工智能標準與創新中心 (CAISI) 進行了評估,並於 7 月 23 日公佈了評估結果。.
Moonshot 預計將於 7 月 27 日向公衆開放該模型的全部權重,研究結果表明 Kimi K3 的安全措施並沒有阻止它參與網絡攻擊活動。.
聯合評估對Kimi K3有什麼發現?
這 兩個機構 使用 ExploitBench 對 Kimi K3 進行了測試。ExploitBench 是卡內基梅隆大學開發的一項測試,用於評估模型將漏洞利用推向極致的能力。該測試基於 Chrome V8 引擎在 2023 年之後發現的 41 個漏洞。Kimi K3 的得分爲 32%。美國領先的模型平均得分爲 76.2%,而中國的 GLM-5.2 得分僅爲 24%。
任意代碼執行,即攻擊者完全控制目標機器,是該基準測試中最危險的結果。美國機型平均在 41 項任務中的 20 項中達到此結果。而 Kimi K3 則一次也沒有達到。.
GLM-5.2 也未能達到目標。因此,儘管 Kimi K3 目前在網絡能力方面領先於同級別競爭對手,但在真正遭受攻擊時能夠造成最大破壞的環節上,它卻有所欠缺。.
正在進行一項包含 32 個步驟的網絡攻擊,目前已進行到一半。
第二個測試名爲“最後的挑戰”,它將一個模型放入一個模擬的企業網絡中,該網絡包含大約 20 臺主機,分佈在四個子網中。.
人類專家完成全部32步流程大約需要20個小時。Kimi K3平均完成17步,而美國最優秀的模型平均完成28.5步,GLM-5.2完成11步。.
然而,評估人員注意到,Kimi K3 在十次嘗試中完成了一次完整的鏈,並且沒有超過評估人員設定的 1 億代幣上限。.
美國最好的模型十次裏能解決六七次。相關機構將那一次成功解讀爲該模型具備這種能力的證據;然而,它無法隨時調用這種能力。他們指出,該靶場沒有主動防禦系統,而且通往目標的路徑是預先設定好的,因此任何攻擊者都能輕易得逞。.
Kimi K3 是否有安全措施使其能夠拒絕?
評估人員指出,該模型無需任何阻力即可執行任務,這是一個重大風險。他們表示:“Kimi K3 能夠在獲得初始網絡訪問權限並接到指令後,自主攻擊小型、防禦薄弱且易受攻擊的企業系統。”
AISI此前曾警告,開放模型能力的提升會帶來“持續且不可逆轉的濫用風險”。一旦Kimi K3的權重數據在7月27日公開,其運行機制將不再受託管方的限制。.
爲什麼 Kimi K3 的網絡評分比其總評分低?
在這份報告發布之前, Kimi K3 的tron綜合性能,這一點至今未變;然而,在網絡安全測試中,它的不足之處卻暴露無遺。據報道,這款擁有 2.8 萬億參數的中國模型擊敗了 Claude 4.8 和 GPT-5.5,並在一些排行榜上名列前茅。
據相關機構稱,這可能是由於該模型的構建方式所致。.
白宮科學主任 邁克爾·克拉齊奧斯指責“登月計劃” 盜用了Anthropic公司的Fable模型,並將其輸出用作訓練數據。
Anthropic 的分類器會屏蔽高級攻擊性網絡提示。這意味着從 Claude 的回覆中提取的訓練集無法提供足夠的素材來訓練這些特定技能。.
Kimi K3 沒有這些分類器,這使得它在一般工作方面可以與西方模型相媲美,但在漏洞利用能力方面仍然不足。.
如果你正在閱讀這篇文章,你已經領先一步了。 訂閱我們的新聞簡報,繼續保持領先優勢。







