tradingkey.logo
搜尋

Kimi K3 在網絡攻擊規劃方面表現遜於美國前沿人工智能模型

Cryptopolitan2026年7月24日 21:00
facebooktwitterlinkedin

一份聯合評估報告指出,在構建軟件漏洞利用程序和運行模擬網絡攻擊方面,Moonshot AI 的 Kimi K3 還達不到美國tron的 AI 系統水平。. 

英國人工智能安全研究所 (AISI) 和美國人工智能標準與創新中心 (CAISI) 進行了評估,並於 7 月 23 日公佈了評估結果。.

Moonshot 預計將於 7 月 27 日向公衆開放該模型的全部權重,研究結果表明 Kimi K3 的安全措施並沒有阻止它參與網絡攻擊活動。.

聯合評估對Kimi K3有什麼發現?

兩個機構 使用 ExploitBench 對 Kimi K3 進行了測試。ExploitBench 是卡內基梅隆大學開發的一項測試,用於評估模型將漏洞利用推向極致的能力。該測試基於 Chrome V8 引擎在 2023 年之後發現的 41 個漏洞。Kimi K3 的得分爲 32%。美國領先的模型平均得分爲 76.2%,而中國的 GLM-5.2 得分僅爲 24%。

任意代碼執行,即攻擊者完全控制目標機器,是該基準測試中最危險的結果。美國機型平均在 41 項任務中的 20 項中達到此結果。而 Kimi K3 則一次也沒有達到。.

GLM-5.2 也未能達到目標。因此,儘管 Kimi K3 目前在網絡能力方面領先於同級別競爭對手,但在真正遭受攻擊時能夠造成最大破壞的環節上,它卻有所欠缺。.

正在進行一項包含 32 個步驟的網絡攻擊,目前已進行到一半。

第二個測試名爲“最後的挑戰”,它將一個模型放入一個模擬的企業網絡中,該網絡包含大約 20 臺主機,分佈在四個子網中。. 

人類專家完成全部32步流程大約需要20個小時。Kimi K3平均完成17步,而美國最優秀的模型平均完成28.5步,GLM-5.2完成11步。.

然而,評估人員注意到,Kimi K3 在十次嘗試中完成了一次完整的鏈,並且沒有超過評估人員設定的 1 億代幣上限。. 

美國最好的模型十次裏能解決六七次。相關機構將那一次成功解讀爲該模型具備這種能力的證據;然而,它無法隨時調用這種能力。他們指出,該靶場沒有主動防禦系統,而且通往目標的路徑是預先設定好的,因此任何攻擊者都能輕易得逞。.

Kimi K3 是否有安全措施使其能夠拒絕?

評估人員指出,該模型無需任何阻力即可執行任務,這是一個重大風險。他們表示:“Kimi K3 能夠在獲得初始網絡訪問權限並接到指令後,自主攻擊小型、防禦薄弱且易受攻擊的企業系統。” 

AISI此前曾警告,開放模型能力的提升會帶來“持續且不可逆轉的濫用風險”。一旦Kimi K3的權重數據在7月27日公開,其運行機制將不再受託管方的限制。.

爲什麼 Kimi K3 的網絡評分比其總評分低?

在這份報告發布之前, Kimi K3 的tron綜合性能,這一點至今未變;然而,在網絡安全測試中,它的不足之處卻暴露無遺。據報道,這款擁有 2.8 萬億參數的中國模型擊敗了 Claude 4.8 和 GPT-5.5,並在一些排行榜上名列前茅。

據相關機構稱,這可能是由於該模型的構建方式所致。.

白宮科學主任 邁克爾·克拉齊奧斯指責“登月計劃” 盜用了Anthropic公司的Fable模型,並將其輸出用作訓練數據。 

Anthropic 的分類器會屏蔽高級攻擊性網絡提示。這意味着從 Claude 的回覆中提取的訓練集無法提供足夠的素材來訓練這些特定技能。. 

Kimi K3 沒有這些分類器,這使得它在一般工作方面可以與西方模型相媲美,但在漏洞利用能力方面仍然不足。.

如果你正在閱讀這篇文章,你已經領先一步了。 訂閱我們的新聞簡報,繼續保持領先優勢。

免責聲明:本網站提供的資訊僅供教育和參考之用,不應視為財務或投資建議。

推薦文章

tradingkey.logo
風險提示:我們的網站和行動應用程式僅提供關於某些投資產品的一般資訊。Finsights 不提供財務建議或對任何投資產品的推薦,且提供此類資訊不應被解釋為 Finsights 提供財務建議或推薦。
投資產品存在重大投資風險,包括可能損失投資的本金,且可能並不適合所有人。投資產品的過去表現並不代表其未來表現。
Finsights 可能允許第三方廣告商或關聯公司在我們的網站或行動應用程式的任何部分放置或投放廣告,並可能根據您與廣告的互動情況獲得報酬。
© 版權所有: FINSIGHTS MEDIA PTE. LTD. 版權所有