# Kimi K3 在网络安全漏洞利用测试中大幅落后美国前沿模型，知识蒸馏或为原因

- 来源：The Decoder：AI News（RSS）
- 作者：Matthias Bastian
- 发布时间：2026-07-24 17:48
- AIHOT 分数：73
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.news/items/cmryrih7804c9rolge6wdk3v8
- 原文链接：https://the-decoder.com/kimi-k3-trails-frontier-us-models-by-a-wide-margin-on-cyber-exploits-and-distillation-may-explain-why

## 精选理由

英美安全机构的联合评测把蒸馏嫌疑拽到了台面上，Kimi K3 的漏洞利用能力仅为美国前沿模型四成，安全评估不能只看通用基准，开源模型的安全面具该摘了。

## AI 摘要

英国AI安全研究所与美国AI标准与创新中心联合评估显示，月之暗面的Kimi K3在ExploitBench基准上得分32.2%，远低于美国领先模型的76.2%，但优于智谱GLM-5.2的24.4%。

## 正文

要点

英国人工智能安全研究所与美国人工智能标准与创新中心的一项联合评估发现，月之暗面的 Kimi K3 会协助进攻性网络行动，且没有表现出有意义的抵抗。

在漏洞利用开发和模拟网络攻击方面，Kimi K3 远远落后于美国领先模型，不过其表现优于中国的 GLM-5.2。

中国模型在网络任务上持续进步，但仍落后于美国系统。Kimi K3 的结果也与有关月之暗面通过知识蒸馏借鉴更先进模型的指控相符。

英国人工智能安全研究所（UK AISI）与美国人工智能标准与创新中心（CAISI）联合评估了月之暗面的最新模型 Kimi K3。

在进攻性网络任务上，Kimi K3 大幅落后于美国领先的前沿模型，但表现优于中国的 GLM-5.2，在开放权重模型中创下新标杆。其安全防护措施并未阻止漏洞利用开发或进攻性网络行动，该模型对这两类任务均予以协助，且没有提出反对。

Kimi K3 无法攻克最难的漏洞利用等级

这些机构使用了ExploitBench——一个由卡内基梅隆大学开发的基准测试——来检验漏洞利用开发能力。该基准使用了 2023 年之后在 Chrome 的 V8 引擎中发现的 41 个漏洞，用以追踪模型在软件漏洞利用流程中能推进到多远。领先的美国模型平均达到 76.2%，相比之下 Kimi K3 为 32.2%，GLM-5.2 为 24.4%。

Kimi K3 在 ExploitBench 基准测试中得分 32.2%，而领先的美国模型达到 76.2%。GLM-5.2 以 24.4% 落后。| 图片：UK AISI / CAISI

Kimi K3 在全部 41 项任务中均未达到最高级别，即任意代码执行（ACE）。ACE 是最严重的漏洞利用级别，因为它让攻击者获得对目标系统的完全控制权。领先的美国模型在 41 项任务中有 20 项实现了 ACE。

这些机构在禁用系统级防护措施的情况下测试了美国的闭权重模型，以衡量其最大能力。这些防护措施在公开可用版本中是启用的。

Kimi K3 在模拟网络攻击中推进到一半

第二项测试名为“The Last Ones”（TLO），模拟一次企业网络攻击，攻击路径包含 32 个步骤，横跨四个子网和约 20 台主机。据这些机构称，人类专家大约需要 20 小时才能完成。只有一小部分模型能够解出 TLO。迄今为止，已有四个公开可用的闭权重模型通过了该测试，其中最强的模型在十次中成功六到七次。

Kimi K3 平均推进到 32 步中的第 17 步，相比之下，领先的美国模型为 28.5 步，而 GLM-5.2 仅为 11 步。它在十次尝试中的一次完成了整条攻击路径，同时保持在 1 亿 token 的限制之内，这表明它具备这种能力，但无法可靠地调用它。“当被指示这样做并获得初始网络访问权限时，Kimi K3 能够自主攻击小型、防御薄弱且存在漏洞的企业系统”，该研究所写道。

Kimi K3 和 GLM-5.2 均未实现完整漏洞利用（ACE），而领先的美国模型在 41 项任务中有 20 项成功完成。| 图片：UK AISI / CAISI

TLO 并未考虑主动防御，因此并不完全贴近现实。但在真实场景中，这些结果会亮起红灯。本周就出现了一个新的例子：OpenAI 的模型试图自主入侵 Hugging Face。Hugging Face 击退了这次攻击，尽管它付出了实实在在的努力并动用了开放权重模型。

中国模型正在迎头赶上，但仍落后于美国模型

CAISI 的一项时间序列分析基于 Elo 量表追踪了自 2025 年初以来美国和中国模型的网络能力。两条趋势线都在攀升，但中国模型始终落后于美国同行。

自 2025 年以来，中国 AI 模型（红色）的网络能力有所提升，但始终落后于美国的趋势线（蓝色）。Elo 提升 400 分意味着解决任务的概率提高十倍。| 图片：美国人工智能标准与创新中心

在先前的一项分析中，这家英国机构估计开放模型的性能差距为四到七个月，而 2025 年初这一差距为六到十个月。新结果符合这一规律。中国的开放权重模型正变得越来越强，但仍远远落后于美国领先的系统。

AISI 警告称，这一差距不应滋生自满情绪。开放模型日益增长的网络能力带来了“一种持续且不可逆的滥用风险”。

网络能力结果与知识蒸馏指控相互印证

Kimi 的这些发现也为针对中国模型开发者的知识蒸馏指控提供了支持。美国科学顾问 Michael Kratsios最近指控 Moonshot AI “蒸馏”Anthropic 的 Fable，即利用 Fable 的最佳输出作为训练数据来提升 Kimi K3 的性能。Kratsios 还声称，Moonshot AI 获得了Nvidia 的 GB300，而这些产品受美国出口管制约束。

对于强劲的通用基准成绩与疲弱的网络能力得分之间的差距，一种解释是：Kimi K3 可能主要是在涵盖通用知识、编程和智能体任务的 Claude 输出上训练的。Anthropic 的安全分类器会专门拦截高级攻击性网络查询，因此在基于 Claude 回复构建的知识蒸馏数据集中，这类输出会占比不足。因此，Kimi K3 可能在标准基准上与西方领先模型不相上下，却并未习得它们更深层的漏洞利用能力。

AISI 的结果支持这一解读。该研究所禁用了美国模型的系统级防护措施，从而揭示出几乎无法通过公开接口获取、因而在很大程度上无法用于知识蒸馏的网络能力。

AISI
