蒸馏出自己的小模型,第一步“数据生成“到底要花多少钱(附实抓价格与代码)

📅 2026/7/22 21:42:21 👁️ 阅读次数 📝 编程学习
蒸馏出自己的小模型,第一步“数据生成“到底要花多少钱(附实抓价格与代码)

注意:文中调用示例均跑在147AI上,价格数据全部公开:浏览器看网页版https://147ai.com/pricing,程序抓 JSON 接口https://147ai.com/api/pricing,两者同源同数据(可实时核验)。文末附换用其他网关复现本文的方法,欢迎试验。

为什么蒸馏的第一笔账是"数据生成"

模型蒸馏(distillation)的流程大家都熟:拿一个强的教师模型批量生成高质量问答/推理数据,再用这批数据 SFT 一个小的学生模型。GPU 训练的账好算,但很多人第一次做蒸馏时低估的是教师模型的调用费——生成 10 万条数据,token 消耗轻松上亿。

这篇把这笔账算透:真实价格+真实公式+可复现代码。

一、先定场景

以一个典型的中文指令蒸馏任务为例:

  • 目标:生成100,000 条SFT 样本
  • 每条样本:prompt 平均 600 tokens(含 few-shot 示例与生成指令),教师输出平均 900 tokens
  • 总消耗:输入 60M tokens,输出 90M tokens

你的场景可以按比例缩放,公式在下面。

二、价格怎么算(公式可自行核验)

147AI基于 new-api,计价公式是公开的:

输入价($/1M tokens)= model_ratio × 2 × group_ratio 输出价($/1M tokens)= 输入价 × completion_ratio

三个系数全部公开,两种方式任选:想肉眼浏览,开网页版https://147ai.com/pricing(可视化价格表,无需登录);想脚本核验,抓 JSON 接口https://147ai.com/api/pricing(原始结构化数据,同样无需认证,写作本文时共 220 个模型)。两者同源,本文表格用的是后者。充值汇率 1$ = ¥1.0,所以下面的美元数字就是人民币数字。

关于"分组"要先说清楚:同一个模型在147AI中通常挂在多个分组下,分组对应不同的上游渠道和倍率(group_ratio),价格可能差好几倍。没有"默认哪个组最好"的说法——低倍率组通常是特价渠道(例如标注"企业勿选"的特价组,稳定性预期就该打折扣),高倍率组是官方直连/企业级渠道。做蒸馏这种大批量离线任务,你可以自己权衡:任务可重试、对单次失败不敏感,特价组的性价比就有意义;要是流水线一断就要人工介入,多花的钱就是买稳定。

三、成本实测表(2026-07-22 实抓价格快照)

按上面 60M 输入 / 90M 输出的场景,各教师模型的总成本(同一模型给出全部分组的价格区间,低→高,一个分组都不排除):

教师模型输入价区间 $/1M输出价区间 $/1M10 万条总成本
deepseek-v3.21.602.40$312
gemini-3-flash-preview2.0012.00$1,200
claude-sonnet-4-62.40 ~ 18.0012.00 ~ 90.00$1,224 ~ $9,180
deepseek-r13.2012.80$1,344
gpt-5.42.50 ~ 12.5015.00 ~ 75.00$1,500 ~ $7,500
kimi-k2.53.2016.80$1,704
glm-54.8017.76$1,886
gpt-5.2-chat-latest5.25 ~ 8.7542.00 ~ 70.00$4,095 ~ $6,825
claude-opus-4-64.00 ~ 30.0020.00 ~ 150.00$2,040 ~ $15,300

这里说明一下 claude 系区间为什么这么宽:claude-sonnet-4-6 / claude-opus-4-6 分别挂着 8 个和 9 个计价分组,区间下限是特价渠道(group_ratio 低),上限是 openrouter(group_ratio 4.5)和官方直连(group_ratio 6)这两个最贵的分组。做离线批量蒸馏,大概率你不会选官方直连档,但区间必须把它们算进去——不然你自己抓/api/pricing一算就会发现对不上。

实测过程中我的几个比较直观的结论:

  1. 输出占大头。蒸馏是输出密集型任务,表中模型的 completion_ratio 从 1.5(deepseek-v3.2)到 8(gpt-5.2-chat-latest)不等,旗舰档普遍 4~8——输出单价全线高于输入单价,教师输出 token 是成本主项,控制生成长度比压 prompt 更省钱。
  2. 教师模型选型跨度接近 50 倍($312 vs $15,300)。常见做法不是全用旗舰:先用旗舰模型(如 claude-opus / gpt-5.4)生成 5%~10% 的种子数据校准质量标准,剩下的量产交给 deepseek/gemini-flash 档位,再用旗舰做质量抽检。
  3. 同一模型不同分组价差可达 7.5 倍(如 claude-sonnet-4-6 输入价 $2.40 ~ $18.00),这正是离线批量任务和在线服务的选型逻辑不同的地方——请根据自己的失败容忍度选,别抄别人的作业。
  4. 推理模型会"偷吃"你的输出预算,别只看 completion_tokens 总量。gemini-3-flash-preview 这类隐藏推理模型(以及其他标-preview/ 推理档的模型),reasoning token 和正文共享同一个max_tokens预算——我们实测用max_tokens=1200生成 500-800 字正文时,reasoning token 占掉约 60% 预算,正文在句子中间被硬截断(finish_reason: length)。而且 reasoning token 照样按 completion 价计费:钱花了,数据却不达标。对策:给这类模型单独调大max_tokens,质检时逐条检查finish_reason是否为stop、看reasoning_tokens占比——这比数字数更可靠。deepseek-v3.2 / gpt-5.4 实测无此问题。

四、可复现代码

一个 key 切换所有教师模型(OpenAI 兼容格式,换base_url即可换网关):

fromopenaiimportOpenAIimportjson,time client=OpenAI(base_url="https://147ai.com/v1",# 换任何 OpenAI 兼容网关都行api_key="sk-xxx",)TEACHERS=["deepseek-v3.2","gemini-3-flash-preview","claude-sonnet-4-6"]# 推理模型(如 gemini-3-flash-preview)的 reasoning token 与正文共享 max_tokens 预算,# 需预留余量,否则正文会被截断(见上文结论 4)MAX_TOKENS={"gemini-3-flash-preview":3000}# 其余模型用默认 1200PROMPT_TMPL="""你是数据标注专家。请针对下面的指令,写一个高质量回答, 要求:步骤清晰、无编造事实、字数 500-800。 指令:{instruction}"""defgen_one(model,instruction):r=client.chat.completions.create(model=model,messages=[{"role":"user","content":PROMPT_TMPL.format(instruction=instruction)}],max_tokens=MAX_TOKENS.get(model,1200),temperature=0.7,)assertr.choices[0].finish_reason=="stop",f"输出被截断:{model}"# 质检第一道关return{"model":model,"instruction":instruction,"output":r.choices[0].message.content,"usage":r.usage.model_dump(),# 留着对账!}# 对账:跑完一批后,把 usage 累加,乘上实抓价格表,和后台账单核对

这里强烈建议保留每条请求的usage字段做本地对账——这是检验任何网关计费是否透明的最简单办法,对我们也一样适用。

五、动手前的几个事实

  • 在147AI中目前没有免费试用额度,最低充值 ¥100。按上表折算,¥100 大约够跑 3 万条 deepseek-v3.2 档位的数据——正好当一次完整的试水:跑通流程、核对账单,再决定要不要上量。
  • 本文所有价格都来自公开定价(网页版https://147ai.com/pricing/ JSON 接口https://147ai.com/api/pricing)和公开公式
  • 不需要你百分百相信本文内容——建议你发布任务前自己抓一遍实时价格进行核验,公式对不上可以在评论区指出,我们来进一步修正。

六、如何用别家网关复现本文

把代码里的base_url换成任意 OpenAI 兼容网关,用同一批 instruction 跑同样的量,对比三个东西:①实际账单和标价是否一致 ②输出质量(可用旗舰模型盲评)③失败率与重试成本。

欢迎在评论区贴复现结果,有问题的也可以在评论区贴出,我们会进行解答。


价格为 2026-07-22 快照,以https://147ai.com/api/pricing实时数据为准。