2.8万亿!全球参数量最大的开源模型Kimi K3,究竟能力如何?

📅 2026/7/22 2:41:44 👁️ 阅读次数 📝 编程学习
2.8万亿!全球参数量最大的开源模型Kimi K3,究竟能力如何?

文章目录

    • 速览
    • 排名对比
      • LiveBench 排名
      • LMArena 排名
      • Artificial Analysis 排名
    • 实测
    • Kimi Code Plan
    • 思考

速览

月之暗面(Moonshot AI)于7月17日(X上的发布时间)发布Kimi K3。

昨天我用了一下,感觉还不错,故写文分享一下。我做的事情是优化OBS(开源录屏软件):

  • 实现随意框选区域进行录屏,无需多余操作;
  • 增加桌面悬浮窗,实现快速录屏和停止、快速录制选区。

这两天稍微处理一下就发布。

回到 Kimi K3,它是目前全球参数规模最大的开源大模型,参数量达到了 2.8 万亿级别。 1M 上下文窗口 + low / high / max 三档思考深度,擅长复杂工程任务与长程推理,原生多模态

目前国内的几个顶级模型都表现不错:Deespseek、GLM、Qwen、Kimi…,而且都是开源。

简单对比一下:

模型厂商发布时间总参数量专家架构上下文窗口模态开源状态
Kimi K3月之暗面07-172.8TMoE (激活约50B)1M多模态:文本、图像、视频输入,文本输出计划开源,完整权重预计 2026 年 7 月 27 日前放出
DeepSeek V4 Pro-Preview深度求索预览版:04-24
正式版即将发布
1.6TMoE (激活约49B)1M纯文本(无多模态)已开源,MIT 协议
GLM-5.2智谱AI06-13753BMoE (激活约40B)1M纯文本(无视觉能力)已开源,MIT 协议
Qwen3.8-Max-Preview阿里云07-192.4TMoE (激活参数未公开)1M多模态:文本、图像、视频、文档预览版闭源,正式版计划开源(时间未定)
MiniMax-M3稀宇科技06-01428BMoE (激活约23B)1M原生多模态:文本、图像、视频开源权重

价格对比:

说明:国产模型以**人民币(元/百万Token)计价,海外模型以美元(USD/百万Token)**计价;价格均为厂商公开的标准零售价格,不含企业定制、批量折扣。具体的各个模型的价格计算可能比下图/表列举的复杂一点,这里就不展开了,大致比较一下。

模型标准输入价标准输出价缓存命中输入价定价规则与备注
Kimi K320 元100 元2 元全上下文窗口统一费率,支持1M token上下文
DeepSeek V4 Pro3 元6 元0.025 元默认开启思考模式无额外加价,1M token上下文统一价
GLM-5.28 元28 元2 元全上下文窗口统一费率,支持1M token上下文
Qwen3.8-Max-Preview约 12 元*约 36 元*约 1.2 元**参考上一代Qwen3.7-Max官方标准价推算;当前为预览阶段,无公开按量付费单价,仅通过订阅Credits计费,预览期享标准价1折优惠
MiniMax-M3≤512K:2.1 元 >512K:4.2 元≤512K:8.4 元 >512K:16.8 元≤512K:0.42 元 >512K:0.84 元官方永久五折后价格,按输入Token长度阶梯计费
GPT-5.6 Sol$5.00$30.00$0.50GPT-5.6系列旗舰版本;同系列还有均衡版Terra($2.5/$15)、轻量版Luna($1/$6)两个档位
Claude Fable 5$10.00$50.00-Anthropic当前旗舰模型,1M token上下文;官方支持上下文缓存(约90%折扣),具体费率未单独公示

可以看到,Kimi K3在国产开源模型中,参数量最大,价格也最高,比此前我觉得贵的GLM-5.2还要贵,不过比GPT和Claude这2个顶级闭源模型便宜。

排名对比

我这几天看到的 Kimi K3 评价都是比较好的,这里再看一下跑分排名吧,这里的排名有专业评测和真人主观评价等不同模式。

Kimi K3、DeepSeek V4 Pro-Preview、GLM-5.2、MiniMax-M3

LiveBench 排名

核心特点:每月更新测试题目,所有问题都有客观标准答案,彻底避免 AI 模型训练数据污染问题

评估维度:数学推理、代码生成、知识问答等多个领域,强调模型的真实学习与问题解决能力

适用场景:适合评估模型的客观能力边界,而非主观用户偏好

官网:https://livebench.ai/

综合排名:Kimi K3来到了第6名。

更多排名情况(数值为得分,得分下面是排名):基本全是最强的

LMArena 排名

核心机构:加州大学伯克利分校 LMSYS 组织开发维护

核心机制:匿名盲测对战,用户在不知模型身份的情况下对两个 AI 回答投票,采用国际象棋 ELO 评分系统

覆盖范围:全球 190 + 主流大模型,涵盖文本对话、数学推理、编程、图像生成等多个竞技场

特点:

  • 月活用户 500 万 +,覆盖 150 + 国家,每月 6000 万 + 模型对话
  • 细分多语言榜单(中文、英文等),数据公开且每日更新
  • 被称为 AI 领域的 “奥运会”,结果反映真实用户体验偏好

官网:https://arena.ai/zh/leaderboard

排名对比(数值为最高排名):

模型TextAgentWebDev
Kimi K3841
DeepSeek V4 Pro432233
GLM-5.2 (Max)29114
MiniMax-M3602421

在前端网页开发这一项排到了全球第一

Artificial Analysis 排名

核心特点:综合 10 项评估维度,从 “AI 智商” 角度全面衡量模型能力,包含逻辑推理、抽象思维、学习能力等

评估方法:结合客观测试与专家评审,结果具有较高参考价值

最新版本:Intelligence Index v3.0,覆盖主流闭源与开源模型

官网:https://artificialanalysis.ai/

排名对比:

评测项目Kimi K3GLM-5.2MiniMax-M3DeepSeek V4 Pro
总体综合指数391515
智能体真实工作任务391114
智能体工具使用182111
代码与终端能力3111618
纯代码能力2141914
复杂推理与知识6101416
科学推理116516
物理推理672114
知识准确率8182610
长上下文推理19219
长周期知识工作27910

和更多模型比较:


从前面的一些排名中可以看到,Kimi K3 整体差不多达到了全球第三的水平,某些领域则达到了第一。

可喜可贺。

但,其实还是有较大差距的。

再来看一下LMArena 排行里面的前10名模型:可以看到这8项排名里面大多数都是GPT和Claude,国产只有12.5%。

对国产模型的崛起,我即为之喜,又为之贺,但不可盲目自信。

实测

如开头所说,我昨天对OBS做了功能优化:

  • 实现随意框选区域进行录屏,无需多余操作;
  • 增加桌面悬浮窗,实现快速录屏和停止、快速录制选区。
  • 绘制区域进行录制时,自动添加默认音频,做到框选后就可以直接录制目标区域音视频。

更多细节后续发布。

最开始是使用GLM-5.2做的,但它一直无法处理自动设置画布分辨率的问题。之后使用 Kimi K3 得以实现。

最终效果如下图:

我是obs深度用户,这项功能的增加,我认为非常使用。

还有几个小功能需要增加,预计这几天就会构建安装包并开源并给官网提交PR。

Kimi Code Plan

不出意外的话,和智谱一样的,套餐售罄:

DeepSeek虽然最便宜,不过高峰期(白天),价格也是翻倍的。

我昨天使用的是opencode的Go套餐里面的,具体介绍我之前文章写的详细:https://mp.weixin.qq.com/s/4_cZOStFYJ-0qF8GOrv-cQ

如果你要尝试Go套餐,可以使用我的要求链接:https://opencode.ai/go?ref=VH6HNYB1GE

你和我都能获得5美元的Go额度。

现在Go套餐里面的K3模型是显示2倍用量,但我的用量依旧消耗的很快,还用了好几个赠送额度。

同时我也订购了火山方舟的Agent Plan,里面也可以选择K3:前面的文章也分享了这个,不重复了

思考

AI发展真的很快,我今年手写的代码很少,大多数都是AI完成的。

一些行业,用时间成本换取薪水的模式或许正在走向终结。

之前看到过一张图:

有点搞笑,但又不无道理。

当我们的技能变成一个个Skill 时,我们还剩下什么呢?

还剩下: 你的判断力、 你的信誉、 你的责任感、 你的随机应变能力…

这些或许才是最后无法被蒸馏的东西。

坦率地说,没有什么是绝对安全的。

AI 的发展速度已经超越了我们预测的精度。

但与其在焦虑中等待被替代,不如把 AI 当作一场倒逼我们进化的海啸。

这场海啸会冲刷掉所有平庸的、机械的技能,迫使我们去面对一个最核心的问题:

当机器可以做得比我们更好时,生而为人的独特意义到底是什么?

这是一个没有标准答案的问题。

未来已来,你认为人类最后一道不可替代的防线,到底在哪里?

我的回答:人类最后不可替代的防线,或许在于“意义的赋予”与“真实的联结”。