摘要
2026年8月7日,《金融时报》援引三位知情人士爆料:字节跳动正在训练一个参数量最高可达10万亿的大模型——这是迄今为止中国AI公司公开过的最大手笔,规模约为Kimi K3(2.8T)的3.6倍,逼近Anthropic Mythos 5的8万亿量级。但更具战略意义的,是比这条消息早一天爆出的另一条新闻:创始人张一鸣给Seed团队下发了"停止蒸馏、加强原创预训练"的内部指令——这意味着字节跳动主动放弃用"蒸馏对手模型"来加速自身进化的捷径。本文从10T模型的算力赌注、Seed团队的研发路线、张一鸣战略转向的背后动因、对中美AI竞争格局的深远影响四个维度进行深度解析。理解字节跳动这一"造星运动"的真正含义,比理解参数数字本身更重要。
核心结论:字节跳动正在从"应用层领先"切换到"基础研究领先"的赛道。10万亿参数不是目的而是手段——它服务于"不再依赖任何海外模型输出"这一战略目标。在Anthropic Mythos 5的"8万亿"、xAI Grok 4.7的"2.1T"、OpenAI Astra的"未公开"参数军备竞赛中,字节通过10T赌注+去蒸馏化双管齐下,向全世界宣告:中国AI有能力在最难的预训练赛道与美国顶级实验室并列竞争。
一、10万亿参数的"含金量":为什么这个数字本身意义有限
1.1 数字背后的架构假设
字节跳动的10万亿模型还未确定最终规模。FT报道明确指出,“10万亿是考虑中的上限”,并非已锁定的最终架构。这意味着该模型至少有3-6个月的时间窗口来确定参数规模、专家数量、激活比例等技术细节。
按当前业界共识,10万亿参数模型几乎必然采用MoE(混合专家)架构——这是因为:
| 模型 | 总参数 | 激活参数 | 激活率 | 架构 |
|---|---|---|---|---|
| DeepSeek V4-Pro | 1.6T | 49B | 3.06% | MoE(DeepSeek MoE) |
| Kimi K3 | 2.8T | 50B | 1.79% | MoE(KDA架构 + 896专家) |
| xAI Grok 4.6 | 1.5T | 约150-200B(估计) | 10-13% | V9稀疏MoE |
| Anthropic Mythos 5 | 约8T(业内估计) | 未公开 | 未公开 | Dense / MoE混合 |
| 字节跳动 | ≤10T | 未公开 | 未公开 | MoE(推测) |
来源:金融时报 (2026-08-07)、晚点LatePost (2026-08-06)、各家模型官方文档
1.2 总参数 ≠ 能力上限
业内专家反复强调:“总参数决定存储成本与训练成本,激活参数决定推理成本与单token能力”。一个10T总参数的MoE模型如果只激活5%的参数(500B),其单次推理的实际算力需求可能还不如一个2T的稠密模型。
字节跳动迄今未公开的关键信息包括:
- 激活参数数量(每token激活多少B参数)
- 专家数量(字节是否走Kimi的896专家路线?)
- 是否复用DeepSeek MoE架构(字节是否有外部授权?)
- KV cache压缩策略(决定长上下文推理成本)
- 训练数据构成(抖音/今日头条/TikTok 25.45亿月活用户数据如何清洗使用?)
这意味着,8月7日的"10万亿"数字更接近于**“算力预算信号”**而非"能力benchmark"。一个3-6个月的预训练周期,加上不公开的激活参数比例,业内人士无法仅凭数字判断这个模型的最终能力。
二、张一鸣的"去蒸馏化"指令:比10T参数更具战略意义
2.1 指令内容与时间线
据Reuters援引澎湃新闻报道,字节跳动创始人张一鸣已在内部给2000人的Seed团队下发了"停止蒸馏对手模型"的明确指令。这条指令比10T模型的爆料至少早一天(8月6日 vs 8月7日),但几乎被业界完全忽略——这恰恰是字节跳动此次战略转向中信息量最大的部分。
张一鸣在Seed全员会上明确表态:宁愿在短期内暂时落后于国内同行,也要坚决放弃通过蒸馏对手模型来加速进化的捷径。
2.2 “蒸馏"为什么是中国大模型的"行业潜规则”
模型蒸馏(Knowledge Distillation)是一种用大模型(教师)的输出训练小模型(学生)的技术。在中国大模型行业,这是公认的"加速追赶"手段:
- DeepSeek R1在2025年初通过蒸馏OpenAI GPT-4的输出,配合强化学习,实现"低成本复现推理能力",震动全行业
- 通义千问Qwen3多版本模型卡明确标注使用了"合成数据"训练,部分来自Claude/GPT系列
- 月之暗面Kimi在早期版本中也涉及使用GPT-4输出作为训练数据
- 字节跳动豆包在2025年下半年的多个版本中,被指"过度依赖"蒸馏Qwen/DeepSeek的输出
这种做法的优势是:短期内可以用10%的算力实现80%能力,让中国模型在OpenRouter、Hugging Face等公共榜单上迅速"看起来很强"。但其代价是原创能力的天花板被锁死——学生模型永远无法突破教师模型的水平。
2.3 张一鸣为何在此刻选择"去蒸馏化"
字节跳动的战略转向发生在三个关键压力点同时出现的时刻:
| 压力点 | 时间 | 内容 |
|---|---|---|
| 国际政治压力 | 2026-02 | Anthropic披露中国主流厂商使用蒸馏技术对抗Claude,指名道姓包括字节跳动 |
| Anthropic蒸馏门 | 2026-02 | Anthropic发布《Distillations Report》,列出具体厂商的蒸馏证据 |
| TikTok美国合资 | 2026-上半年 | 字节保留TikTok US 19.9%股权,进入高度监管状态 |
字节跳动此次被Anthropic的蒸馏报告中特意回避——这是一个引人注目的细节。Anthropic的蒸馏报告点名了多家中国厂商,字节跳动不在其列。结合张一鸣"早在2023年就已有不蒸馏政策"的说法,这意味着字节跳动很可能是中国大厂中唯一长期坚持不蒸馏的厂商,只是在2026年8月才正式将这一策略公开化。
2.4 "去蒸馏化"的产业意义
对字节跳动自身而言:
- 短期代价:在lm-arena、OpenRouter等榜单上暂时落后于DeepSeek等蒸馏对手
- 长期收益:获得在Anthropic Mythos、OpenAI Astra等最前沿模型上"不被卡脖子"的能力上限
- 政治安全:在美国国会、AI安全研究所、海关审查中不会被列入"知识产权侵犯"清单
对中国AI行业而言:
- 打破内卷式捷径:DeepSeek R1蒸馏路径被广泛模仿,字节的转向可能引发行业反思
- 强化原创能力:迫使中国厂商从依赖合成数据转向依赖"原始数据 + 算力 + 算法"三要素
- 重新定义竞争维度:从"看谁能更快蒸馏出榜单分数"转向"看谁能持续投入原创预训练"
三、Seed团队的"工程、组织与算力"三角支撑
3.1 算力:30000块GPU的赌注
知情人士透露,字节跳动此次训练至少部署了30000块GPU,训练周期预计3-6个月。这一数字可以反推字节的算力储备:
- 2026年英伟达GPU采购预算:$140亿(Bloomberg)
- 2026年AI总资本支出:$230亿+(原计划$160亿已上调25%)
- 算力来源:H200、B200系列(在特朗普政府时期出口管制放松后获得)
- 现有集群规模:至少5-6万块GPU可用于预训练
按当前云端GPU租用价格(H200约$2-3/小时)计算,10T模型单次完整预训练成本约**$1.5亿-3亿**——这还没算数据准备、超参调优、失败重试的额外开销。
3.2 组织:2000人的Seed团队
字节跳动的Seed团队规模约2000人,由Seed Foundation负责人项亮主导,与大语言模型预训练数据负责人沈科合作。该团队是字节AI研究的核心力量,2025年下半年完成了多个内部组织调整:
- 飞书团队拆分:产品团队并入豆包,销售线划归火山引擎
- 算力整合:火山引擎 + 飞书 + 豆包资源整合,构筑算力和数据上的优势
- 张一鸣 + 吴永辉(Seed负责人)联合决议:明确编程(Coding)的关键地位
字节跳动CEO梁汝波在8月6日的字节年度全员会"All-Hands"上坦言:“豆包大模型在AI Coding方面并不算突出”,并以Anthropic Claude Code举例。这种"自揭短板"的公开表态,反映了字节高层对AI Coding这一关键赛道的焦虑。
3.3 数据:3亿+月活的天然优势
字节跳动拥有中国最具规模的应用数据生态:
| 产品 | 月活用户 | 数据特点 |
|---|---|---|
| 抖音/TikTok国际版 | 10亿+ | 视频/图文/音频多模态数据 |
| 豆包 | 3.24亿(2026.3) | 中文对话、Agent交互数据 |
| 今日头条 | 数亿 | 长文本、知识问答 |
| 剪映/CapCut | 数亿 | 视频编辑、视觉生成 |
3.24亿豆包MAU每日产生数亿次对话、数千万次工具调用——这些"真实世界反馈信号"是任何开源合成数据都无法替代的。
但同时,豆包的"结构性失衡"也值得关注:日收入不到100万元,但每日算力消耗数千万。这意味着字节每训练一个10T模型,都是在赌未来能够变现——而变现路径目前并不清晰。
四、对中美AI竞争格局的深远影响
4.1 "Anthropic Mythos量级"的意义
FT报道中提到的"Mythos 5约8万亿参数"是行业估计而非官方数据,但这个对比本身揭示了一个重要事实:
中国头部AI公司第一次有底气公开与美国顶级实验室进行"参数规模对标"。
| 公司 | 模型 | 估计参数 | 中国/美国 |
|---|---|---|---|
| OpenAI | GPT-5.6 / Astra | 未公开(估计>5T) | 美国 |
| Anthropic | Claude Mythos 5 | 估计约8T | 美国 |
| Gemini 3 Pro | 未公开(估计~1-2T) | 美国 | |
| xAI | Grok 4.7 | 2.1T(公开) | 美国 |
| Meta | Llama 4 Behemoth | 估计~2T | 美国 |
| 字节跳动 | 未命名(训练中) | ≤10T | 中国 |
| 阿里 | Qwen3.8 MAX | 2.4T | 中国 |
| 月之暗面 | Kimi K3 | 2.8T | 中国 |
来源:The Decoder (2026-08-07)、Tech Fast Forward (2026-08-07)、晚点LatePost (2026-08-06)
字节跳动的10T赌注意味着:在Anthropic Mythos 5(8T)、OpenAI未公开超大模型、Google Gemini 4(2026 Q4完成)的"美国AI四巨头"格局中,中国厂商首次在"公开声称的最大训练规模"维度上正面竞争。
4.2 美国出口管制的"窗口期"风险
FT报道和The Decoder分析均未触及,但这是所有中国前沿模型训练面临的共同风险:
- 特朗普政府2026年上半年的出口管制放松是字节能采购到H200/B200的关键
- 如果2026年Q4美国政策反转,10T模型的微调和后训练阶段可能受限于芯片供应
- 芯片采购涉及实体清单、海外子公司、租赁结构等复杂金融工程,字节已通过阿里云、火山引擎、TikTok等通道做了风险分散
4.3 字节跳动的"独特定位":消费AI的反向溢出
与DeepSeek(月之暗面)专注API经济、Kimi(月之暗面)专注OpenRouter榜单不同,字节跳动的10T模型最可能的应用场景是自家产品:
- 豆包需要更智能的多模态对话能力(应对GPT-5.6、Claude Opus 5的竞争)
- 抖音/TikTok需要更精准的视频推荐和内容生成
- 剪映/CapCut需要视频编辑AI(如已开源的SeedRealtime的下一代)
- 飞书(尽管已分拆)需要办公自动化AI
- 火山引擎(B端)需要差异化模型对外销售
字节跳动的"练好模型服务自家产品+向B端溢出"路径,比单纯卖API的模式更具商业可持续性。但这也意味着10T模型最终的"成功标准"不会是榜单分数,而是豆包MAU、抖音推荐CTR、剪映付费转化等业务指标。
五、关键FAQ
Q1:字节跳动的10万亿模型何时发布?
A:目前预训练阶段还需3-6个月,预计最早2026年底到2027年初才能完成预训练。微调、后训练、safety alignment、推理优化再需要3-6个月。综合估算公开发布时间不早于2027年Q2,且发布形式可能是"内测+灰度"而非全面公开。
Q2:10万亿参数一定意味着更强能力吗?
A:不一定。总参数是"训练数据记忆+潜在能力上限"的综合反映,但实际能力还取决于:激活参数比例(MoE架构的核心指标)、训练数据质量(多模态覆盖、语言覆盖、专业领域深度)、对齐技术(SFT+RLHF+DPO的精细度)。GPT-4实际只有约1.8T总参数但能力极强,恰恰说明参数规模不是唯一决定因素。
Q3:字节跳动的"不蒸馏"政策能持续多久?
A:短期内(1-2年)字节可以依靠豆包+抖音+剪映等自有数据储备保持原创训练。但长期看(3-5年),如果国内其他厂商通过蒸馏快速形成"能力压制",字节的"原创路线"将面临股东和管理层的压力。这是一场耐心资本的赌注,考验字节高层的长期主义。
Q4:10万亿模型的训练对中国AI产业链有何影响?
A:直接利好:
- 国产GPU:华为昇腾、摩尔线程、沐曦等芯片厂商将获得更多订单机会
- 国产存储/网络:高速SSD、InfiniBand替代品、光模块厂商受益
- 国产数据:高质量中文数据集、合成数据工具链需求增加
- 能源/电力:10万卡级集群对电力供应的拉动效应显著
间接影响:可能加速国内其他厂商(阿里、腾讯、蚂蚁、DeepSeek)跟进而形成"算力军备竞赛",进一步推高中国AI整体算力规模。
Q5:这对中国AI出海有什么启示?
A:字节跳动的TikTok在全球150+国家拥有25亿+用户,是其AI出海的天然渠道。10T模型如果能与TikTok的内容理解、推荐系统、广告投放深度整合,可能形成**“美国AI无法复制”**的差异化优势——即"用户场景+数据闭环+基础模型"的三位一体。这种"反向溢出"模式,与DeepSeek的"开源技术输出"、Kimi的"API盈利"形成鲜明对比。
六、参考资料
- Financial Times (2026-08-07).ByteDance trains 10 trillion parameter model to rival Anthropic Mythos
- 晚点LatePost (2026-08-06).独家|字节跳动拟训练参数超5万亿的大模型
- The Decoder (2026-08-07).ByteDance founder Zhang Yiming tells Seed team to stop distilling rival models
- 智东西 (2026-08-07).曝字节训10亿参数大模型,或超Mythos 5,张一鸣、梁汝波先后发声
- 凤凰网科技 (2026-08-07).外媒:字节跳动训练10万亿参数超大模型
- Tech Fast Forward (2026-08-07).ByteDance Builds 10T Model to Surpass Anthropic Mythos
- AI Weekly (2026-08-07).ByteDance pretrains 10-trillion parameter model, FT reports
- AI2.work (2026-08).ByteDance’s 10 Trillion Parameter Bet and Its Distillation Ban
- Bloomberg (2026-05-27).ByteDance’s AI chip capex plan
- South China Morning Post (2026).ByteDance Nvidia AI chip spending budget
- 财新 (2026-08-06).字节跳动CEO梁汝波All-Hands发言
- Anthropic (2026-02).Distillations Report - February 2026
- OpenRouter (2026-08).Global Model Call Volume Rankings
- Artificial Analysis (2026-08).AI Model Performance Index
- 知乎 (2026-08).关于字节跳动Seed团队组织架构调整的解读