2.8 万亿参数 Kimi K3 技术报告:MoE 架构、KDA 注意力与百万 Token 上下文全解析
📅 2026/7/31 16:41:23
👁️ 阅读次数
📝 编程学习
文章目录
- 概述
- 核心结果
- 编码能力
- 通用与视觉智能体
- 1 引言
- 2 模型架构
- 2.1 混合注意力机制
- 2.1.1 Kimi Delta注意力(KDA)
- 2.1.2 门控MLA
- 2.2 注意力残差(AttnRes)
- 2.3 稳定潜空间混合专家(Stable LatentMoE)
- 2.3.1 归一化潜空间MoE
- 2.3.2 Sigmoid Tanh单元GLU(SiTU-GLU)
- 2.3.3 分位数均衡(QB)
- 2.4 原生视觉能力
- 2.5 逐头Muon优化器
- 3 预训练
- 3.1 预训练数据
- 3.2 缩放法则
- 3.3 训练方案
- 3.4 长上下文扩展
- 4 训练后流程
- 4.1 方法
- 4.1.1 监督微调(SFT)
- 4.1.2 强化学习
- 4.1.3 多教师同策略蒸馏(MOPD)
- 4.1.4 部署感知的训练后流程
- 4.2 RL任务合成与智能体环境
- 4.2.1 统一白盒RL环境
- 4.2.2 知识图谱引导的任务合成
- 4.2.3 智能体环境中的可验证问题
- 4.2.4 内核优化任务
- 4.2.5 个人助手任务
- 4.2.6 自主执行任务
- 4.2.7 网页开发任务
- 5 基础设施
- 5.1 KDA的算法-系统协同设计
- 5.1.1 多场景KDA内核
- 5.1.2 KDA上下文并行(KCP)
- 5.2 3万亿级预训练基础设施
- 5.2.1 完美均衡的专家并行MoE训练
- 5.2.2 内存高效训练
- 5.2.3 多模态编码器优化
- 5.3 百万token智能体RL基础设施
- 5.3.1 长上下文RL基础设施
- 5.3.2 沙箱基础设施
- 5.4 推理与在线服务
- 5.4.1 KDA感知的前缀缓存管理
- 5.4.2 高性能内核
- 5.4.3 集群级调度
- 6 评测
- 6.1 核心结果
- 6.1.1 基准测试集
- 6.1.2 基线模型
- 6.1.3 评测配置
- 6.1.4 结果
- 6.2 内部评测
- 6.2.1 能力评测
- 6.2.2 网络安全评测
概述
Kimi K3——一款总参数2.8万亿的混合专家(MoE)模型,单token激活参数为1040亿,具备原生视觉能力,支持100万token上下文窗口。Kimi K3 基于 Kimi Delta 注意力机制(KDA)[64]与注意力残差(AttnRes)[58]构建,优化了序列长度与模型深度维度的信息流动。结合稳定潜空间混合专家(Stable LatentMoE,每个token可从896个路由专家中有效激活16个),以及经过优化的训练与数据方案,这些技术进步让 Kimi K3 的整体缩放效率较 Kimi K2 [59]提升约2.5倍。
训练后阶段的亮点在于通用、智能体与编码三大领域的强化学习,以及多档位推理算力支持,实现了组合泛化能力与稳定长时序执行能力。在2.8万亿参数规模下,Kimi K3 依托多领域基础设施突破落地:KDA的算法-系统协同设计、实现完美负载均衡的专家并行训练与高效内存管理、支持持久化推演与沙箱状态的百万token智能体强化学习,以及多项部署侧创新。
全面评测显示,Kimi K3 在长时序编码、智能体、知识、推理与视觉任务上均达到前沿水平。尽管整体性能仍略逊于最强闭源模型 Claude Fable 5 与 GPT-5.6 Sol,但在kimi团队的评测体系中,Kimi K3 持续优于其他所有开源与闭源模型。kimi团队已开放 Kimi K3 的完整模型权重,以推动后续研究,加速前沿智能技术的更广泛部署与应用。
核心结果
所有结果均采用最高推理算力档位:max 或 xhigh
编码能力
编程学习
技术分享
实战经验