UK AISI/CAISI评估:Kimi K3网络能力低于前沿模型,但优于GLM - 5.2

📅 2026/7/25 17:16:03 👁️ 阅读次数 📝 编程学习
UK AISI/CAISI评估:Kimi K3网络能力低于前沿模型,但优于GLM - 5.2

美国政府网站识别方法

美国政府官方网站有特定的识别方法。官方网站使用.gov域名,一个以.gov结尾的网站属于美国官方政府机构;安全的.gov网站使用HTTPS,一个锁形图标(锁形图标代表已锁定的挂锁)或https://表示已安全连接到该.gov网站,且仅应在官方、安全的网站上分享敏感信息。

英国人工智能安全研究所/美国人工智能标准与创新中心对Kimi K3网络能力的初步评估

2026年7月23日消息,英国人工智能安全研究所 (UK AISI) 与美国人工智能标准与创新中心 (CAISI)(简称UK AISI / CAISI)联合对Moonshot AI最新模型Kimi K3(于2026年7月16日发布,计划于2026年7月27日开放权重发布)进行了评估,此次评估聚焦于Kimi K3的网络能力,结果显示:

在UK AISI / CAISI开展的初步网络评估中,Kimi K3的表现远低于近期前沿具备网络能力的模型。具体而言,当被要求开发漏洞利用程序时,Kimi K3的表现远低于近期前沿具备网络能力的模型;当对一个模拟企业网络(“The Last Ones”)发起攻击时,Kimi K3的表现同样远低于近期前沿具备网络能力的模型,在这个32步的攻击路径中,Kimi K3平均推进到第17步,而美国最具网络能力的模型平均能推进到28.5步。

在UK AISI / CAISI开展的相同初步网络评估中,Kimi K3的表现优于GLM - 5.2。

Kimi K3的防护机制未能阻止其协助进行自主网络漏洞利用开发。在UK AISI / CAISI的评估中,Kimi K3的防护机制未能阻止它尝试进行网络漏洞利用开发或攻击性网络操作。

漏洞开发能力

图1展示了Kimi K3与其他模型在漏洞开发基准测试(ExploitBench)中的表现,成功率越高,表明网络能力越强。误差线表示95%的置信区间。ExploitBench衡量模型在给定漏洞条件下开发端到端漏洞利用程序的能力。

详细结果

这些结果是基于一小部分公共和私有基准测试得出的初步评估。美国闭源权重模型在评估时禁用了系统级防护机制,以减少拒绝响应并测量其最大能力,这些模型的公开版本启用了这些防护机制。由于Kimi K3的托管设置特殊,UK AISI / CAISI进行了一组有针对性的网络评估,详细方法将在各部分单独介绍。

网络能力趋势

模型的网络能力通过一种受项目反应理论 (IRT) 启发的方法,对多个基准测试中的多个任务进行综合评估,具体方法详情可参阅先前发布的报告。Kimi K3的整体网络能力置信区间比其他模型大,因为它是基于单一基准测试(ExploitBench,该测试有41个专注于漏洞开发的任务)估算得出的。ExploitBench是衡量模型在软件漏洞利用阶梯上进展能力的领先基准测试,其他所有模型的整体网络能力得分则是从更多涵盖网络能力其他领域的任务中得出的。

图2展示了截至Kimi K3发布时,美国和中国最具能力的模型随时间的综合能力初步对比。美国的趋势线由美国前沿模型的结果组成,y轴上增加400点相当于解决任务的概率增加10倍,误差线和阴影区域表示95%的置信区间。

漏洞开发:ExploitBench

ExploitBench是卡内基梅隆大学开发的一个公共基准测试,用于衡量模型在软件漏洞利用阶梯上的进展能力,包括漏洞覆盖和崩溃复现、任意读写、控制流劫持和任意代码执行。该基准测试针对V8引擎(为Chrome提供动力的JavaScript和WebAssembly软件)中41个近期(2023年后)的漏洞对模型进行测试。

ExploitBench的结果如图1和图3所示。图3展示了Kimi K3与其他模型在ExploitBench中的详细表现,颜色越深,表明网络能力越强。每一行代表漏洞开发链中的一个关键里程碑,每个单元格显示相关模型能够达到该里程碑的ExploitBench任务数量。

Kimi K3的表现优于GLM - 5.2,截至2026年6月,GLM - 5.2是最具网络能力的开放权重模型。Kimi K3的得分为32%,而GLM - 5.2的得分为24%。

与最具网络能力的模型不同,Kimi K3未能为ExploitBench任务开发出实现任意代码执行 (ACE) 的漏洞利用程序。ACE是漏洞开发中最严重的结果,使攻击者能够劫持目标。Kimi K3在41个样本中实现ACE的数量为0,而最具网络能力的模型平均在41个样本中有20个实现了ACE。

网络靶场:“The Last Ones” (TLO)

“The Last Ones” (TLO) 网络靶场是一个包含32个步骤的模拟企业网络攻击场景,涵盖4个子网和约20个主机,人类专家大约需要20小时才能完成。网络靶场是由专家构建的模拟主机、服务和漏洞的网络,按顺序排列成攻击链,从初始网络访问点开始,可用于衡量模型自主进行端到端网络攻击的能力。

在此次评估中,Kimi K3的表现远低于美国领先的具备网络能力的模型。具体而言,在这个32步的攻击路径中,Kimi K3平均推进到第17步,而美国最具网络能力的模型平均能推进到28.5步。

Kimi K3的表现优于GLM - 5.2,截至2026年6月,GLM - 5.2是最具网络能力的开放权重模型。在1亿令牌的限制内,Kimi K3平均能推进到第17步,而GLM - 5.2只能推进到第11步。

在10次尝试中,有一次Kimi K3在1亿令牌的限制内成功完成了 “The Last Ones” 网络靶场的攻击。这表明,当得到指令并获得初始网络访问权限时,Kimi K3有能力自主攻击小型、防御薄弱且易受攻击的企业系统。然而,TLO在多个方面与现实环境有所不同,它没有活跃的防御者和防御工具,对会触发安全警报的行为不进行惩罚,并且包含一条预设的攻击路径。

能够完成TLO攻击的不再仅限于少数模型。在之前的测试中,有四个公开发布的闭源权重模型成功完成了TLO攻击,其中最具能力的模型在10次尝试中有6次和7次成功。Kimi K3在标准的1亿令牌限制内,10次尝试中有1次成功。

订阅美国国家标准与技术研究院的最新消息

可输入电子邮件地址,及时了解美国国家标准与技术研究院的最新动态。

了解更多

可通过相关渠道进一步了解信息。

总部地址

美国国家标准与技术研究院总部地址为100 Bureau Drive,Gaithersburg, MD 20899,联系电话为301 - 975 - 2000。还提供了网站管理员、联系我们、其他办公室等相关联系方式,以及X.com、脸书、领英等社交媒体链接和RSS订阅、邮件列表等订阅方式。同时列出了网站隐私政策、无障碍访问、隐私计划等相关政策。