tradingkey.logo
搜索

Kimi K3 在网络攻击规划方面表现逊于美国前沿人工智能模型

Cryptopolitan2026年7月24日 21:00
facebooktwitterlinkedin

一份联合评估报告指出,在构建软件漏洞利用程序和运行模拟网络攻击方面,Moonshot AI 的 Kimi K3 还达不到美国tron的 AI 系统水平。. 

英国人工智能安全研究所 (AISI) 和美国人工智能标准与创新中心 (CAISI) 进行了评估,并于 7 月 23 日公布了评估结果。.

Moonshot 预计将于 7 月 27 日向公众开放该模型的全部权重,研究结果表明 Kimi K3 的安全措施并没有阻止它参与网络攻击活动。.

联合评估对Kimi K3有什么发现?

两个机构 使用 ExploitBench 对 Kimi K3 进行了测试。ExploitBench 是卡内基梅隆大学开发的一项测试,用于评估模型将漏洞利用推向极致的能力。该测试基于 Chrome V8 引擎在 2023 年之后发现的 41 个漏洞。Kimi K3 的得分为 32%。美国领先的模型平均得分为 76.2%,而中国的 GLM-5.2 得分仅为 24%。

任意代码执行,即攻击者完全控制目标机器,是该基准测试中最危险的结果。美国机型平均在 41 项任务中的 20 项中达到此结果。而 Kimi K3 则一次也没有达到。.

GLM-5.2 也未能达到目标。因此,尽管 Kimi K3 目前在网络能力方面领先于同级别竞争对手,但在真正遭受攻击时能够造成最大破坏的环节上,它却有所欠缺。.

正在进行一项包含 32 个步骤的网络攻击,目前已进行到一半。

第二个测试名为“最后的挑战”,它将一个模型放入一个模拟的企业网络中,该网络包含大约 20 台主机,分布在四个子网中。. 

人类专家完成全部32步流程大约需要20个小时。Kimi K3平均完成17步,而美国最优秀的模型平均完成28.5步,GLM-5.2完成11步。.

然而,评估人员注意到,Kimi K3 在十次尝试中完成了一次完整的链,并且没有超过评估人员设定的 1 亿代币上限。. 

美国最好的模型十次里能解决六七次。相关机构将那一次成功解读为该模型具备这种能力的证据;然而,它无法随时调用这种能力。他们指出,该靶场没有主动防御系统,而且通往目标的路径是预先设定好的,因此任何攻击者都能轻易得逞。.

Kimi K3 是否有安全措施使其能够拒绝?

评估人员指出,该模型无需任何阻力即可执行任务,这是一个重大风险。他们表示:“Kimi K3 能够在获得初始网络访问权限并接到指令后,自主攻击小型、防御薄弱且易受攻击的企业系统。” 

AISI此前曾警告,开放模型能力的提升会带来“持续且不可逆转的滥用风险”。一旦Kimi K3的权重数据在7月27日公开,其运行机制将不再受托管方的限制。.

为什么 Kimi K3 的网络评分比其总评分低?

在这份报告发布之前, Kimi K3 的tron综合性能,这一点至今未变;然而,在网络安全测试中,它的不足之处却暴露无遗。据报道,这款拥有 2.8 万亿参数的中国模型击败了 Claude 4.8 和 GPT-5.5,并在一些排行榜上名列前茅。

据相关机构称,这可能是由于该模型的构建方式所致。.

白宫科学主任 迈克尔·克拉齐奥斯指责“登月计划” 盗用了Anthropic公司的Fable模型,并将其输出用作训练数据。 

Anthropic 的分类器会屏蔽高级攻击性网络提示。这意味着从 Claude 的回复中提取的训练集无法提供足够的素材来训练这些特定技能。. 

Kimi K3 没有这些分类器,这使得它在一般工作方面可以与西方模型相媲美,但在漏洞利用能力方面仍然不足。.

如果你正在阅读这篇文章,你已经领先一步了。 订阅我们的新闻简报,继续保持领先优势。

免责声明:本网站提供的信息仅供教育和参考之用,不应视为财务或投资建议。

推荐文章

tradingkey.logo
风险提示:我们的网站和移动应用程序仅提供关于某些投资产品的一般信息。Finsights 不提供财务建议或对任何投资产品的推荐,且提供此类信息不应被解释为 Finsights 提供财务建议或推荐。
投资产品存在重大投资风险,包括可能损失投资的本金,且可能并不适合所有人。投资产品的过去表现并不代表其未来表现。
Finsights 可能允许第三方广告商或关联公司在我们的网站或移动应用程序的任何部分放置或投放广告,并可能根据您与广告的互动情况获得报酬。
© 版权所有: FINSIGHTS MEDIA PTE. LTD. 版权所有