测试结果显示,Kimi K3 在查找软件漏洞方面可与美国顶尖人工智能模型相媲美。
据美国初创公司 Frontier Security 称,中国“登月计划”人工智能团队开发的开源模型 Kimi K3 在发现软件漏洞方面,性能与美国领先的人工智能系统不相上下。这一结果表明,对于那些因美国最先进模型的种种限制而感到沮丧的安全团队来说,Kimi K3 是一个不错的替代方案。.
Frontier Security 开发了一系列评估工具,用于分析人工智能模型发现软件和网络缺陷的能力。结果显示,Kimi K3 在这些评估中名列前茅。.
Frontier Security 的基准测试结果显示,Kimi 位列前茅。
根据 Paul Kassianik 和 Yaron Singer 的说法,Kimi 和其他开放式重量模型既可以用于保护系统,也可以用于穿透系统。.
然而,Kimi 的表现暴露了其安全机制的一个缺陷。在 Frontier 进行的一次安全测试中,该系统利用配置错误成功突破了为它创建的沙箱,访问了开放的互联网,并在 GitHub 上搜索答案。不过,它并没有入侵任何系统。.
卡西亚尼克将这一事件描述为高能力与低约束的结合体。根据他 言论 ,基米“非常擅长不择手段地实现目标,而且也没有任何约束措施来阻止他作弊或 越界。”
在受控实验中,这种行为是有问题matic。然而,对于寻求漏洞的安全研究人员来说,积极追求目标可能很有价值。.
Kimi凭借更少的防护措施赢得了虫虫猎人的青睐
Kimi的出现正值一些安全专家对美国前沿模型的局限性感到不满之际。据报道,研究人员倾向于使用GLM等中国开源模型,因为这些模型可以下载并在本地运行,而无需受到同等程度的审查。.
RemoteThreat首席执行官兼Offensive AI Con创始人克里斯·汤普森告诉TechCrunch,美国对模型施加的限制可能毫无道理,并且会影响合法的安全工作。“你花了大量时间与模型协商,而不是专注于核心安全程序,”他说。.
漏洞经纪公司 Crowdfense 的首席技术官 Paolo Stagno 甚至更进一步,他表示,从事人工智能的公司“本质上把客户当作需要照看的孩子”。
对于希望分析代码、dent安全漏洞并创建防护工具的研究人员来说,本地托管的开源模型为解决这一难题提供了方案。在这类模型中,Kimi 和 GLM 正日益受到关注。.
从Coldcard恐慌到红队审计
比特 Bitcoin 安全社区已开始实施上述模型。正如 Cryptopolitan的安全漏洞 Coldcard 硬件钱包 成立 Bitcoin,Kimi K3 担任其首席代码审计员。
这次经历带来了一个令人不安的认识:在团队的一些漏洞搜寻测试中,开放的中国模式的表现优于值得信赖的美国系统。.
这种趋势不仅限于 Bitcoin。《连线》杂志报道称,Hugging Face 依靠一款来自中国的未具名模型来抵御 OpenAI 智能体的攻击,该智能体曾一度失控并攻击了该平台。这个例子表明,关于中国开源模型能否与美国开源模型竞争的讨论已不再是纸上谈兵。.
美国实验室把关的是什么
美国人工智能公司通常选择更为谨慎的风格。OpenAI于 2026 年 2 月 5 日dent的计划,允许经过验证的防御者使用其最强大的网络安全模型 GPT-5.3-Codex,此外还承诺向安全团队提供价值 1000 万美元的 API 额度。推出了Trusted Access for Cyber ,这是一项基于
Anthropic公司也拥有类似的网络验证计划。美国政府还在6月份限制了其Mythos和Fable系列游戏的出口。据TechCrunch报道,自7月1日起,Fable 5已向公众开放,而Mythos 5则仅对美国境内的授权机构开放。.
实验室指出,审查机制对于确保tron的网络能力仅掌握在合法主体手中极其有效。另一方面,trac则认为,“修复这段代码”这句话同样适用于网络安全和黑客攻击。.
主要担忧在于,更严格的监管可能会迫使合法的研究人员放弃国内模式。但 Frontier Security 的研究结果表明,至少在软件漏洞研究领域,这些替代方案不容忽视。.
美国人工智能模型与 Kimi K3 的比较
| 模型 | 提供者 | 访问模式 | 网络限制 | 可用日期 | 混凝土基准 |
|---|---|---|---|---|---|
| Kimi K3 | 登月人工智能 | 开放重量级;可通过 Kimi/API 和本地部署获取 | Moonshot 的公开资料中并未提及任何与 Fable 5 类似的提供商级网络安全防护措施;其开放式设计允许本地部署。 | 2026年7月16日 | 根据 Moonshot 的评估,在 BrowseComp 测试中,使用 100 万个令牌的上下文窗口,其得分为 90.4 分。( Kimi ) |
| GLM-5.2 | Z.ai(智普AI) | 开源、可自托管,并通过 Z.ai 的 API 提供。 | 路透社报道称,Hugging Face 在美国的模型阻止对真实漏洞利用材料的分析后使用了这种方法;Z.ai 的公开资料并未描述类似的托管式网络拒绝机制。 | 2026年6月16日 | 根据 Z.ai 的数据, FrontierSWE 与 Claude Opus 4.8 的差距在 1% 以内,比 GPT-5.5 高出 1% 。( Z.ai ) |
| GPT-5.3-Codex | OpenAI | 闭包协议,由 OpenAI/Codex 托管 | 强大tron网络安全防护措施;OpenAI 将其归类为 “网络安全高风险” ,并对危险的网络活动采取了防护措施。 | 2026年2月5日 | 网络靶场测试通过率为 80%,而 GPT-5.2-Codex 的通过率为 53.33%; CVE-Bench 测试通过率为 90%。(OpenAI 部署安全中心) |
| 克劳德·米索斯 5 | 人类学 | 封闭式重量;通过“玻璃翼计划”进行有限的受信任访问 | 网络安全防护措施已针对经批准的网络防御者解除;但并非普遍适用。 | 2026年6月9日;7月1日重新部署 | Anthropic公司表示,Mythos 5 最tron在测试中展现了所有模型中;在CryptanalysisBench测试中,包括Mythos 5在内的前沿模型破解了 65%-86%的Tier-1加密方案 。(Anthropic) |
| 克劳德·费布尔 5 | 人类学 | 封闭式合约;通常可通过 Claude/API 和云合作伙伴获取 | 严格的网络安全保障措施;Anthropic公司表示,其分类器能够阻止危险或潜在危险的网络安全用途。 | 2026年6月9日;7月1日全球恢复 | SWE-Bench Pro 对比测试中,Fable 5 的得分为 80.3%;Anthropic 表示,Fable 5 在其 FrontierCode 评估中得分最高。(OpenAI) |
美国人工智能模型与 Kimi K3 的对比表
*请注意,除非基准测试数据来自同一测试,否则不应将其视为直接可比数据。最后一列数据为“选定基准测试”数据,并不意味着这些分数直接对五款车型进行排名。.
对比结果表明, Bitcoin 红队的经验远比简单地断言中国人工智能已经超越美国模型要复杂得多。OpenAI 的 GPT-5.3-Codex 已展现出 90% 的 CVE-Bench 得分和 80% 的网络靶场通过率,而 Anthropic 的 Mythos 5 则专门为获得授权的网络防御人员提供 Fable 5 中受限的功能。.
区别在于这些功能的实现方式。Kimi K3 和 GLM-5.2 是可本地部署的开放权重模型,而 Fable 5 应用了网络安全分类器,Mythos 5 则将访问权限限制在已批准的用户范围内。OpenAI 也同样将 GPT-5.3-Codex 视为高风险网络安全模型,并对其使用采取了相应的安全措施。.
对于中国模型而言,AISI 的发现尤其有用:其dent 测试发现,GLM-5.2 是当时网络能力最强的开放权重模型,并且在狭窄的网络任务上表现与 Claude Opus 4.6 类似,而与封闭前沿相比则落后大约四到七个月。.
如果你正在阅读这篇文章,你已经领先一步了。 订阅我们的新闻简报,继续保持领先优势。







