2.8 万亿参数 Kimi K3 技术报告:MoE 架构、KDA 注意力与百万 Token 上下文全解析

📅 2026/7/31 16:41:23 👁️ 阅读次数 📝 编程学习
2.8 万亿参数 Kimi K3 技术报告:MoE 架构、KDA 注意力与百万 Token 上下文全解析

文章目录

    • 概述
    • 核心结果
      • 编码能力
      • 通用与视觉智能体
    • 1 引言
    • 2 模型架构
      • 2.1 混合注意力机制
        • 2.1.1 Kimi Delta注意力(KDA)
        • 2.1.2 门控MLA
      • 2.2 注意力残差(AttnRes)
      • 2.3 稳定潜空间混合专家(Stable LatentMoE)
        • 2.3.1 归一化潜空间MoE
        • 2.3.2 Sigmoid Tanh单元GLU(SiTU-GLU)
        • 2.3.3 分位数均衡(QB)
      • 2.4 原生视觉能力
      • 2.5 逐头Muon优化器
    • 3 预训练
      • 3.1 预训练数据
      • 3.2 缩放法则
      • 3.3 训练方案
      • 3.4 长上下文扩展
    • 4 训练后流程
      • 4.1 方法
        • 4.1.1 监督微调(SFT)
        • 4.1.2 强化学习
        • 4.1.3 多教师同策略蒸馏(MOPD)
        • 4.1.4 部署感知的训练后流程
      • 4.2 RL任务合成与智能体环境
        • 4.2.1 统一白盒RL环境
        • 4.2.2 知识图谱引导的任务合成
        • 4.2.3 智能体环境中的可验证问题
        • 4.2.4 内核优化任务
        • 4.2.5 个人助手任务
        • 4.2.6 自主执行任务
        • 4.2.7 网页开发任务
    • 5 基础设施
      • 5.1 KDA的算法-系统协同设计
        • 5.1.1 多场景KDA内核
        • 5.1.2 KDA上下文并行(KCP)
      • 5.2 3万亿级预训练基础设施
        • 5.2.1 完美均衡的专家并行MoE训练
        • 5.2.2 内存高效训练
        • 5.2.3 多模态编码器优化
      • 5.3 百万token智能体RL基础设施
        • 5.3.1 长上下文RL基础设施
        • 5.3.2 沙箱基础设施
      • 5.4 推理与在线服务
        • 5.4.1 KDA感知的前缀缓存管理
        • 5.4.2 高性能内核
        • 5.4.3 集群级调度
    • 6 评测
      • 6.1 核心结果
        • 6.1.1 基准测试集
        • 6.1.2 基线模型
        • 6.1.3 评测配置
        • 6.1.4 结果
      • 6.2 内部评测
        • 6.2.1 能力评测
        • 6.2.2 网络安全评测

概述

Kimi K3——一款总参数2.8万亿的混合专家(MoE)模型,单token激活参数为1040亿,具备原生视觉能力,支持100万token上下文窗口。Kimi K3 基于 Kimi Delta 注意力机制(KDA)[64]与注意力残差(AttnRes)[58]构建,优化了序列长度与模型深度维度的信息流动。结合稳定潜空间混合专家(Stable LatentMoE,每个token可从896个路由专家中有效激活16个),以及经过优化的训练与数据方案,这些技术进步让 Kimi K3 的整体缩放效率较 Kimi K2 [59]提升约2.5倍。

训练后阶段的亮点在于通用、智能体与编码三大领域的强化学习,以及多档位推理算力支持,实现了组合泛化能力与稳定长时序执行能力。在2.8万亿参数规模下,Kimi K3 依托多领域基础设施突破落地:KDA的算法-系统协同设计、实现完美负载均衡的专家并行训练与高效内存管理、支持持久化推演与沙箱状态的百万token智能体强化学习,以及多项部署侧创新。

全面评测显示,Kimi K3 在长时序编码、智能体、知识、推理与视觉任务上均达到前沿水平。尽管整体性能仍略逊于最强闭源模型 Claude Fable 5 与 GPT-5.6 Sol,但在kimi团队的评测体系中,Kimi K3 持续优于其他所有开源与闭源模型。kimi团队已开放 Kimi K3 的完整模型权重,以推动后续研究,加速前沿智能技术的更广泛部署与应用。

核心结果

所有结果均采用最高推理算力档位:max 或 xhigh

编码能力