測試結果顯示,Kimi K3 在查找軟件漏洞方面可與美國頂尖人工智能模型相媲美。
據美國初創公司 Frontier Security 稱,中國“登月計劃”人工智能團隊開發的開源模型 Kimi K3 在發現軟件漏洞方面,性能與美國領先的人工智能系統不相上下。這一結果表明,對於那些因美國最先進模型的種種限制而感到沮喪的安全團隊來說,Kimi K3 是一個不錯的替代方案。.
Frontier Security 開發了一系列評估工具,用於分析人工智能模型發現軟件和網絡缺陷的能力。結果顯示,Kimi K3 在這些評估中名列前茅。.
Frontier Security 的基準測試結果顯示,Kimi 位列前茅。
根據 Paul Kassianik 和 Yaron Singer 的說法,Kimi 和其他開放式重量模型既可以用於保護系統,也可以用於穿透系統。.
然而,Kimi 的表現暴露了其安全機制的一個缺陷。在 Frontier 進行的一次安全測試中,該系統利用配置錯誤成功突破了爲它創建的沙箱,訪問了開放的互聯網,並在 GitHub 上搜索答案。不過,它並沒有入侵任何系統。.
卡西亞尼克將這一事件描述爲高能力與低約束的結合體。根據他 言論 ,基米“非常擅長不擇手段地實現目標,而且也沒有任何約束措施來阻止他作弊或 越界。”
在受控實驗中,這種行爲是有問題matic。然而,對於尋求漏洞的安全研究人員來說,積極追求目標可能很有價值。.
Kimi憑藉更少的防護措施贏得了蟲蟲獵人的青睞
Kimi的出現正值一些安全專家對美國前沿模型的侷限性感到不滿之際。據報道,研究人員傾向於使用GLM等中國開源模型,因爲這些模型可以下載並在本地運行,而無需受到同等程度的審查。.
RemoteThreat首席執行官兼Offensive AI Con創始人克里斯·湯普森告訴TechCrunch,美國對模型施加的限制可能毫無道理,並且會影響合法的安全工作。“你花了大量時間與模型協商,而不是專注於核心安全程序,”他說。.
漏洞經紀公司 Crowdfense 的首席技術官 Paolo Stagno 甚至更進一步,他表示,從事人工智能的公司“本質上把客戶當作需要照看的孩子”。
對於希望分析代碼、dent安全漏洞並創建防護工具的研究人員來說,本地託管的開源模型爲解決這一難題提供了方案。在這類模型中,Kimi 和 GLM 正日益受到關注。.
從Coldcard恐慌到紅隊審計
比特 Bitcoin 安全社區已開始實施上述模型。正如 Cryptopolitan的安全漏洞 Coldcard 硬件錢包 成立 Bitcoin,Kimi K3 擔任其首席代碼審計員。
這次經歷帶來了一個令人不安的認識:在團隊的一些漏洞搜尋測試中,開放的中國模式的表現優於值得信賴的美國系統。.
這種趨勢不僅限於 Bitcoin。《連線》雜誌報道稱,Hugging Face 依靠一款來自中國的未具名模型來抵禦 OpenAI 智能體的攻擊,該智能體曾一度失控並攻擊了該平臺。這個例子表明,關於中國開源模型能否與美國開源模型競爭的討論已不再是紙上談兵。.
美國實驗室把關的是什麼
美國人工智能公司通常選擇更爲謹慎的風格。OpenAI於 2026 年 2 月 5 日dent的計劃,允許經過驗證的防禦者使用其最強大的網絡安全模型 GPT-5.3-Codex,此外還承諾向安全團隊提供價值 1000 萬美元的 API 額度。推出了Trusted Access for Cyber ,這是一項基於
Anthropic公司也擁有類似的網絡驗證計劃。美國政府還在6月份限制了其Mythos和Fable系列遊戲的出口。據TechCrunch報道,自7月1日起,Fable 5已向公衆開放,而Mythos 5則僅對美國境內的授權機構開放。.
實驗室指出,審查機制對於確保tron的網絡能力僅掌握在合法主體手中極其有效。另一方面,trac則認爲,“修復這段代碼”這句話同樣適用於網絡安全和黑客攻擊。.
主要擔憂在於,更嚴格的監管可能會迫使合法的研究人員放棄國內模式。但 Frontier Security 的研究結果表明,至少在軟件漏洞研究領域,這些替代方案不容忽視。.
美國人工智能模型與 Kimi K3 的比較
| 模型 | 提供者 | 訪問模式 | 網絡限制 | 可用日期 | 混凝土基準 |
|---|---|---|---|---|---|
| Kimi K3 | 登月人工智能 | 開放重量級;可通過 Kimi/API 和本地部署獲取 | Moonshot 的公開資料中並未提及任何與 Fable 5 類似的提供商級網絡安全防護措施;其開放式設計允許本地部署。 | 2026年7月16日 | 根據 Moonshot 的評估,在 BrowseComp 測試中,使用 100 萬個令牌的上下文窗口,其得分爲 90.4 分。( Kimi ) |
| GLM-5.2 | Z.ai(智普AI) | 開源、可自託管,並通過 Z.ai 的 API 提供。 | 路透社報道稱,Hugging Face 在美國的模型阻止對真實漏洞利用材料的分析後使用了這種方法;Z.ai 的公開資料並未描述類似的託管式網絡拒絕機制。 | 2026年6月16日 | 根據 Z.ai 的數據, FrontierSWE 與 Claude Opus 4.8 的差距在 1% 以內,比 GPT-5.5 高出 1% 。( Z.ai ) |
| GPT-5.3-Codex | OpenAI | 閉包協議,由 OpenAI/Codex 託管 | 強大tron網絡安全防護措施;OpenAI 將其歸類爲 “網絡安全高風險” ,並對危險的網絡活動採取了防護措施。 | 2026年2月5日 | 網絡靶場測試通過率爲 80%,而 GPT-5.2-Codex 的通過率爲 53.33%; CVE-Bench 測試通過率爲 90%。(OpenAI 部署安全中心) |
| 克勞德·米索斯 5 | 人類學 | 封閉式重量;通過“玻璃翼計劃”進行有限的受信任訪問 | 網絡安全防護措施已針對經批准的網絡防禦者解除;但並非普遍適用。 | 2026年6月9日;7月1日重新部署 | Anthropic公司表示,Mythos 5 最tron在測試中展現了所有模型中;在CryptanalysisBench測試中,包括Mythos 5在內的前沿模型破解了 65%-86%的Tier-1加密方案 。(Anthropic) |
| 克勞德·費布爾 5 | 人類學 | 封閉式合約;通常可通過 Claude/API 和雲合作伙伴獲取 | 嚴格的網絡安全保障措施;Anthropic公司表示,其分類器能夠阻止危險或潛在危險的網絡安全用途。 | 2026年6月9日;7月1日全球恢復 | SWE-Bench Pro 對比測試中,Fable 5 的得分爲 80.3%;Anthropic 表示,Fable 5 在其 FrontierCode 評估中得分最高。(OpenAI) |
美國人工智能模型與 Kimi K3 的對比表
*請注意,除非基準測試數據來自同一測試,否則不應將其視爲直接可比數據。最後一列數據爲“選定基準測試”數據,並不意味着這些分數直接對五款車型進行排名。.
對比結果表明, Bitcoin 紅隊的經驗遠比簡單地斷言中國人工智能已經超越美國模型要複雜得多。OpenAI 的 GPT-5.3-Codex 已展現出 90% 的 CVE-Bench 得分和 80% 的網絡靶場通過率,而 Anthropic 的 Mythos 5 則專門爲獲得授權的網絡防禦人員提供 Fable 5 中受限的功能。.
區別在於這些功能的實現方式。Kimi K3 和 GLM-5.2 是可本地部署的開放權重模型,而 Fable 5 應用了網絡安全分類器,Mythos 5 則將訪問權限限制在已批准的用戶範圍內。OpenAI 也同樣將 GPT-5.3-Codex 視爲高風險網絡安全模型,並對其使用採取了相應的安全措施。.
對於中國模型而言,AISI 的發現尤其有用:其dent 測試發現,GLM-5.2 是當時網絡能力最強的開放權重模型,並且在狹窄的網絡任務上表現與 Claude Opus 4.6 類似,而與封閉前沿相比則落後大約四到七個月。.
如果你正在閱讀這篇文章,你已經領先一步了。 訂閱我們的新聞簡報,繼續保持領先優勢。








