Qwen 3.7 Max、Kimi K3、DeepSeek V4 实测评估:34倍价差下的性能差异分析

📅 2026/8/3 23:33:24 👁️ 阅读次数 📝 编程学习
Qwen 3.7 Max、Kimi K3、DeepSeek V4 实测评估:34倍价差下的性能差异分析


三个中国旗舰家族,同一套评测,跑完它的花费相差 34 倍。 最强和最弱之间的能力差是 13 个 index 分。账单差是 $2,365。

  • 能力最强:Kimi K3 (max),Artificial Analysis Intelligence Index v4.1 得 57 分

  • 性价比断层第一:DeepSeek V4 Flash 0731,50 分,跑完 index 只花 $72.02

  • 最快:Qwen 3.7 Max,206.4 输出 token/秒

  • 意外之处:这一组里最便宜的模型,分数压过了它所低于的两个旗舰

  • 四个模型今天都在 ofox 上,所以切换只是改一个 model ID

摘要:你该选哪个?

你的处境理由
最难的推理,预算不是约束Kimi K3四个里分数最高,57 分
高频 agent 循环,成本主导DeepSeek V4 Flash 073150 分,同一套评测的花费比 K3 低 34 倍
延迟比最后几分更要紧Qwen 3.7 Max206.4 tok/s 对 K3 的 35
需要图片输入Kimi K3Qwen 3.8 Max另外三个在目录里是纯文本
今天还在用 DeepSeek V4 Pro重新评估Flash 0731 高 6 分,花费低 2.4 倍
给混合负载挑一个默认模型DeepSeek V4 Flash 0731分数每美元领先一个数量级,且 1M 上下文
想用最新的 QwenQwen 3.8 Max比 3.7 Max 便宜,但还没有第三方分数

两种可以就此打住的情况。月 token 支出低于约 $200,直接选 DeepSeek V4 Flash 就走,下面所有优化都不值你花一个下午。生产环境的 agent 循环月支出超过 $2,000,直接跳到评测花费那一节,34 倍就在那里。

规格快速对照

下表数据全部来自 ofox 模型目录,2026-08-03 实时拉取。

Kimi K3DeepSeek V4 FlashDeepSeek V4 ProQwen 3.7 Max
模型 IDmoonshotai/kimi-k3deepseek/deepseek-v4-flashdeepseek/deepseek-v4-probailian/qwen3.7-max
输入 / 每百万$3.00$0.14$0.45$2.50
输出 / 每百万$15.00$0.28$0.88$7.50
缓存读 / 每百万$0.30$0.0028$0.0037$0.50
上下文窗口1,048,5761,000,0001,000,0001,064,000
最大输出1,048,576384,000384,00064,000
输入模态文本、图片文本文本文本
开源权重有(MIT)

这张表里有三处值得停下来看。

缓存读那一列不是四舍五入的差别。DeepSeek 的缓存输入是 $0.0028 每百万。Qwen 3.7 Max 同样一件事收 $0.50,是179 倍;K3 收 $0.30,是107 倍。如果你的负载有一份大的、被反复读取的系统提示词,决定账单的是缓存读单价,不是那个显眼的输入单价。

Qwen 3.7 Max 的 64K 输出上限是四个里最紧的,比 DeepSeek 紧六倍,比 K3 紧十六倍。如果你的任务是「读一个大仓库,产出一个大文件」,最先卡住你的是这个上限而不是别的。Qwen 3.8 Max 把它提到了 131K,细节见 Qwen 3.8 Max 发布拆解。

只有 K3 同时具备开源权重和第一梯队分数。DeepSeek 的权重是 MIT 且可下载,但它在这里的最高分来自便宜的那个模型而不是旗舰。Qwen 3.7 Max 完全没有开源权重,不过阿里已宣布 Max 级别的开源权重发布定在 2026-08-10 那一周。

同一把尺子量出来是什么结果?

Artificial Analysis Intelligence Index v4.1,快照 2026-08-03。这是本文唯一一个用同样方法测过全部四个模型的来源,整篇对比都锚在它上面。

模型Index 分数本组排名
Kimi K3 (max)571
DeepSeek V4 Flash 0731502
Qwen 3.7 Max463
DeepSeek V4 Pro(Reasoning, Max Effort)444

这个 index 是九项评测的合成:GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1、SciCode、Humanity’s Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR。

看排序,别抠绝对分。这是一个滚动榜,index 版本和模型构建变了就会重新打分,所以「K3 第一、Flash 第二」比「57 和 50」更经得起时间。Flash 与 Qwen 3.7 Max 之间那 4 分的差距,在一次重跑就可能翻转的范围内。

不会变的是这个意外的方向:这一组里最便宜的模型压在两个旗舰之上,其中一个还是同一家厂商的。

有三件事会改变这个排名,而且三件在一个季度内都可能发生:

  • Qwen 3.8 Max 被收录。它比 3.7 Max 便宜,阿里自己的表也把它放在明显领先上一代的位置。如果它以 $2.00/$6.00 的价格落在 K3 附近,性价比这一列就要重排。

  • DeepSeek 再出一个构建。0731 那次重训在架构不变的情况下把 Flash 拉高了 10 分,没有理由认为那是最后一次。

  • Index 版本变化。v4.1 增加并重新加权了评测项;一个 v4.2 完全可能在没有任何模型改变的情况下,把只差 4 分的两个模型换位。

所以更该做的是每季度重跑自己的评测,而不是从任何一篇文章(包括这篇)继承一份排名。

各家厂商也都发自己的表,而那些表互相之间不可比。Qwen 给 3.8 Max 发的表对标的是 Claude 和 GPT,评测框架是 Qwen 自己选的。Moonshot 的 K3 发布表里 Terminal-Bench 2.1 是 88.3,而榜首是 88.8,那是第二不是第一。DeepSeek 自己报的 V4 Flash 的 Terminal-Bench 分数高于 Artificial Analysis 对同一模型测出的值。这是三套不同的测量设置,把它们混进一张表,就是一篇对比变得毫无意义的方式。

跑完同一套评测到底要花多少钱?

这个数字重新定义了整场对比。Artificial Analysis 会公布自己在每个模型上跑完 index 的总花费,所以这是同一份工作量的真账单,而不是拿单价乘出来的估算。

模型Index 分数产生的输出 token跑完 index 的花费
Kimi K3 (max)57130M$2,437.41
Qwen 3.7 Max46100M$1,604.13
DeepSeek V4 Pro44180M$176.34
DeepSeek V4 Flash 073150210M$72.02

从这四行推算出来(derived):

  • K3 的花费是 V4 Flash 的33.8 倍,换来+7分。

  • Qwen 3.7 Max 的花费是 V4 Flash 的22.3 倍,而且低 4 分

  • V4 Pro 的花费是 V4 Flash 的2.4 倍,而且低 6 分

  • K3 的花费是 Qwen 3.7 Max 的1.5 倍,换来+11分。

关于价格列的一点说明:Artificial Analysis 把 DeepSeek V4 Pro 标为 $0.435 / $0.87,而 ofox 目录四舍五入成 $0.45 / $0.88。评测花费那几个数字来自 Artificial Analysis,用的是它自己的单价;上面的规格表用的是目录的。

这四组对比里只有一组算是一笔交易,另外三组描述的是「又贵又差」。

K3 的溢价至少说得通:你比 Qwen 3.7 Max 多付 1.5 倍,换到实打实的 11 分,如果你的工作卡在最难的推理上,这是一次理性采购。而比 V4 Flash 多付 22 倍、分数还低 4 分,这不是交易,这是 2026-07-31 之后没人重跑过数字留下的惯性。

为什么最便宜的模型能压过两个旗舰?

因为 0731 是重训而不是新模型,而它把分数抬了 10 分。DeepSeek V4 Flash 0731 保持了同样的 284B 总参、13B 激活的 MoE 架构,回来时从上一版的 40 分变成了 50 分。

答案的另一半是啰嗦,而这一半对 DeepSeek 不利。

  • V4 Flash 在这套 index 上产生了210M 输出 token,四个里最多。

  • Qwen 3.7 Max 产生了100M,最少。

  • 也就是说同样的活,Flash 吐出的 token 是 Qwen 的2.1 倍

这就是实际差距小于单价差距的原因。Qwen 3.7 Max 的输出单价是 Flash 的 26.8 倍($7.50 对 $0.28),但真实账单只差 22.3 倍。Flash 靠多说话把大约五分之一的价格优势还了回去,然后还是赢了一大截。

DeepSeek 默认开启思考,而推理 token 按输出计费,啰嗦就是从这里来的。它可以关掉。但关掉的同时,你也放弃了一部分把 Flash 顶到两个旗舰之上的那个分数,所以决定之前先用自己的 prompt 两种模式各测一遍。

这一节的实用版本:按 token 的标价是一个很差的成本代理指标。单价差 27 倍的两个模型,干完同样的活只差 22 倍;单价差 1.5 倍的两个模型,干完同样的活差了 2.4 倍。模型之间的 token 用量差异,比价格差异更大。

换成你的月账是多少?

一套 benchmark 不是你的工作负载。下面把同一场对比放到一个具体团队上,单价用规格表里 ofox 目录的值。

场景:5 个开发者跑编码 agent。

  • 每人每天 40 个任务,每月 21 个工作日

  • 中位任务:12,000 输入 token 的仓库上下文,3,000 输出 token

  • 40% 的输入命中提示词缓存

每人每月的量:1,008 万输入 token(403 万命中缓存,605 万未命中)和 252 万输出 token。

缓存输入未缓存输入输出每人5 人团队
Kimi K3$1.21$18.14$37.80$57.15$285.77
Qwen 3.7 Max$2.02$15.12$18.90$36.04$180.18
DeepSeek V4 Pro$0.01$2.72$2.22$4.95$24.77
DeepSeek V4 Flash$0.01$0.85$0.71$1.56$7.82

K3 与 Flash 之间落在 36.5 倍,与 index 那次跑出来的 33.8 倍很接近。两份完全不同的工作负载给出同一个量级的比值,是这个比值站得住的一个合理信号。

对这张表要做一处修正,而且对 Flash 不利。它假设每个模型每个任务都吐 3,000 个输出 token,而 index 那次的数据说这是错的:同样的活 Flash 吐的 token 是 Qwen 的 2.1 倍。把 Flash 的输出那一行乘 2.1,团队月成本从 $7.82 变成约 $11.70,与 K3 的差距从 36.5 倍降到大约 24 倍。

仍然是 24 倍。啰嗦税是真的,但它远远填不平这条沟。

这个场景会在哪里误导你:

  • 缓存命中率在这里承担了很多。40% 命中的情况下,DeepSeek 近乎免费的缓存读几乎看不出来,因为绝对值太小。换成一份 20 万 token 的系统提示词、每天被读几百次的负载,那一列会变成账单的全部,差距只会更大。

  • 它给 token 定价,不给结果定价。如果 K3 一次做完的事 Flash 要重试三次,重试成本和工程师时间会把上面所有数字淹没。

  • 单价会动。DeepSeek 这两个构建在过去一个季度里价格和分数都变过。承诺之前先拉当前值。

它们各自有多快?

Qwen 3.7 Max 的输出吞吐是 Kimi K3 的 5.9 倍。

模型输出 token/秒
Qwen 3.7 Max206.4
DeepSeek V4 Pro55.0
Kimi K3 (max)35
DeepSeek V4 Flash 0731未公布

Artificial Analysis 把 K3 标为明显偏慢、V4 Pro 标为低于平均,而 Qwen 3.7 Max 在其价格档里明显高于平均。写作时 0731 这一版 Flash 还没有公布速度测量,所以那一格留空,不拿上一版的数字去填。

速度改变的东西和分数不一样。12 分的 index 差距体现为模型能不能完成某类任务。5.9 倍的吞吐差距体现为一次 40 分钟的 agent 运行会不会变成四小时。对交互式工具和长自治循环来说,后者往往才是人真正感觉到的约束。

什么时候该选 Kimi K3?

当任务在另外三个上失败,而失败的代价高于 token 的时候。

具体信号:

  • 你的评测显示其他模型是在某一类任务上失败,而不只是做得差一点。

  • 你需要图片输入配上第一梯队推理。这一条我们在 2026-08-03 通过网关实测过:发一张图让 prompt token 从 97 涨到 189,并返回了准确描述,所以视觉是真通而不只是列在字段里。

  • 你需要一次性产出非常长的回复。K3 的 1,048,576 最大输出是 Qwen 3.7 Max 上限的 16 倍。

  • 你希望分数最高的那个同时是开源权重,K3 是,Qwen 3.7 Max 不是。

不该选它的信号:高请求量、对延迟敏感的交互,或者任何你还没真正量出质量差异的负载。35 token/秒加 $15 每百万输出,K3 对「量大」和「性急」两件事都会惩罚。它在中国模型之外的位置见 Kimi K3 对比 GPT-5.5 与 Opus 4.8,接入方式见 Kimi K3 使用指南。

什么时候该选 DeepSeek V4 Flash?

当作默认,直到有什么东西让它失败为止。

它在四个里排第二,成本低一个数量级,有 1M 上下文窗口和 384K 输出上限,还带 MIT 开源权重。反对它的理由很窄:

  • 纯文本。没有图片输入,任何碰截图或图片型文档的管线都用不了。

  • 啰嗦。这套 index 上 210M 输出 token,四个里最多。要为推理 token 留预算,长循环上给max_tokens设上限。

  • 比 K3 低 7 分。这是真的,在你最难的那一小块工作上会显出来。

如果你现在用的是DeepSeek V4 Pro,这一节是最该动手的。Flash 0731 高 6 分,跑同一套评测的花费低 2.4 倍。任何「难的给 Pro、简单的给 Flash」的路由规则,都是对着一个已经不存在的构建写的。跨厂商的预算档对比见 V4 Flash 对比 Gemini 3.6 Flash,V4 系列的整体情况见 DeepSeek V4 发布指南。

什么时候该选 Qwen?

当吞吐是约束的时候,或者你本来就在阿里的生态里。

Qwen 3.7 Max 在这一组里的论据是速度:206.4 输出 token/秒,接近 V4 Pro 的 4 倍、K3 的 6 倍。对一个用户盯着 token 一个个冒出来的对话产品,或者一个按墙钟而不是按美元衡量的 agent 循环,这是任何 index 分数都捕捉不到的真实产品差异。

反对它的论据是,在这组数字上它能力居中、成本靠上,这个位置很尴尬。它比一个跑同样评测便宜 22 倍的模型还低 4 分。

而且它已经不是阿里最新的了。Qwen 3.8 Max 在 2026-08-03 上线,$2.00/$6.00,两边都比 3.7 Max 便宜,输出上限 131K,还带图片输入。它没有进这场对比,是因为写作时 Artificial Analysis 还没有它的页面,没有可以并列的同法分数。如果你今天是在挑一个 Qwen 而不是在比公开数字,起点应该是 3.8 Max。更便宜的同系列见 3.7 Plus 与 3.7 Max 实测对比。

什么时候一个都别选?

三种情况下,这整个货架都是错的:

  • 你需要视频输入。四个模型通过网关都不接受。Qwen 3.8 Max 的目录条目只列了文本和图片,尽管 QwenCloud 自己的页面列了视频。

  • 你需要它们没有的某个特定前沿能力。如果你的评测是按 Claude 或 GPT 的行为校准的,7 分的 index 差距不会告诉你这次替换安不安全。跑你自己的评测集。

  • 你的瓶颈不在模型上。如果一个检索 bug 或一个糟糕的提示词比 token 账单更贵,本文所有数字都帮不上忙。

通过 ofox 一次跑通三家:10 行做 A/B

四个模型在同一个目录里,所以这场对比是一个遍历 model ID 的循环,不是四次接入。

Python:同一个 prompt 跑遍四个模型

import os from openai import OpenAI client = OpenAI( api_key=os.getenv("OFOX_API_KEY"), base_url="https://api.ofox.io/v1", ) MODELS = [ "moonshotai/kimi-k3", "deepseek/deepseek-v4-flash", "deepseek/deepseek-v4-pro", "bailian/qwen3.7-max", ] prompt = "重构这个模块,并说明迁移过程中的风险。" for model in MODELS: r = client.chat.completions.create( model=model, messages=[{"role": "user", "content": prompt}], max_tokens=2048, ) u = r.usage print(f"{model:<32} out={u.completion_tokens:<7} total={u.total_tokens}")

Node:同样的形状

import OpenAI from "openai"; const client = new OpenAI({ apiKey: process.env.OFOX_API_KEY, baseURL: "https://api.ofox.io/v1", }); for (const model of ["moonshotai/kimi-k3", "deepseek/deepseek-v4-flash", "bailian/qwen3.7-max"]) { const r = await client.chat.completions.create({ model, messages: [{ role: "user", content: prompt }], max_tokens: 2048, }); console.log(model, r.usage.completion_tokens); }

打印completion_tokens,不要只看延迟。上面那张评测花费表的全部意义就在于:这几个模型之间 token 用量的差异比价格差异更大,所以在你自己的 prompt 上得到的每模型输出 token 数,比任何公开榜单都值钱。

关于目录字段的一点提醒。K3 的条目只列了/v1/chat/completions,而 Qwen 和 DeepSeek 的条目还列了/v1/responses。这个字段在两个方向上都出错过,所以按你打算用的协议发一个真请求,别拿 metadata 做规划。各模型当前单价见 Kimi K3、DeepSeek V4 Flash 和 Qwen 3.7 Max 的模型页。

常见问题

2026 年最好的中国模型是哪个?
按 Artificial Analysis Intelligence Index v4.1 在 2026-08-03 的快照,Kimi K3 (max) 的 57 分是这一组里最高的。按每美元得分算,DeepSeek V4 Flash 0731 领先大约一个数量级。

Kimi K3 比 DeepSeek V4 Flash 贵这么多值吗?
它用同一套评测 33.8 倍的花费买到 7 个 index 分。只有当某一类任务在 Flash 上失败而在 K3 上成功时才值,而这件事你必须用自己的 prompt 量出来。

DeepSeek V4 Flash 有开源权重吗?
有。0731 这一版在 Hugging Face 上是deepseek-ai/DeepSeek-V4-Flash-0731,MIT 许可,fp8,非 gated。

为什么这篇比的是 Qwen 3.7 Max 而不是 3.8 Max?
因为写作时 Artificial Analysis 还没有 3.8 Max 的页面,没有和另外三个用同一套方法测出的分数。Qwen 3.7 Max 是有可比第三方数字的最新 Qwen。

哪个模型的输出上限最大?
Kimi K3,1,048,576 token。DeepSeek 那两个是 384,000,Qwen 3.7 Max 是 64,000。

这几个里有支持视觉的吗?
Kimi K3 支持,2026-08-03 通过网关实测过。Qwen 3.8 Max 支持。Qwen 3.7 Max 和两个 DeepSeek V4 在目录里都是纯文本。

Artificial Analysis 那个花费就是我的账单吗?
不是。那是一套特定的 9 项评测,它告诉你的是模型之间在固定工作量上的比值,不是你的绝对支出。用它排序,然后用自己的 prompt 去测。

本次核实的来源

  • Kimi K3 (max) - Intelligence, Performance & Price Analysis

  • DeepSeek V4 Flash 0731 (max) - Intelligence, Performance & Price Analysis

  • DeepSeek V4 Pro (max) - Intelligence, Performance & Price Analysis

  • Qwen3.7 Max - Intelligence, Performance & Price Analysis

  • Kimi K3 API - 价格、上下文与接入 | OfoxAI

  • DeepSeek V4 Flash API - 价格、上下文与接入 | OfoxAI

  • Qwen3.7 Max API - 价格、上下文与接入 | OfoxAI

  • GET https://api.ofox.io/v1/models(2026-08-03 实调,取 model ID、价格、上下文与模态字段)

  • 针对moonshotai/kimi-k3的图片输入实测,2026-08-03:带图 prompt token 189,同一 prompt 不带图 97,描述准确