从 GPT-2 到 Kimi K3:22580 倍背后,真正改变的是 AI 的“记忆方式”

📅 2026/7/31 6:12:22 👁️ 阅读次数 📝 编程学习
从 GPT-2 到 Kimi K3:22580 倍背后,真正改变的是 AI 的“记忆方式”

从 GPT-2 到 Kimi K3:22580 倍背后,真正改变的是 AI 的“记忆方式”

原帖《22580: From GPT2 to Kimi3, Explained》可以用一句话概括:

从 GPT-2 到 Kimi K3,大模型真正的进步不只是参数变多,而是学会了更高效地保存、修改、遗忘和重新检索信息。

一、“22580”究竟是什么意思?

原帖采用约 1.24 亿参数的 GPT-2 作为基准,而 Kimi K3 总参数量为 2.8 万亿:

2.8 万亿 ÷ 1.24 亿 ≈ 22580

所以,一个 Kimi K3 的总参数量大约相当于 22580 个小型 GPT-2。

但这不代表 Kimi K3 的智力、速度或者效果是 GPT-2 的 22580 倍。Kimi K3 是 MoE 混合专家模型,虽然拥有 2.8 万亿总参数,但每个 token 实际激活的参数约为 1040 亿。其官方规格为:93 层、69 层 KDA、24 层 Gated MLA、896 个路由专家,每次选择其中16个,另有2个共享专家。MoonshotAI 官方资料

因此,“22580”更像一个有冲击力的规模对比,不是性能倍数。

二、GPT-2:把全部历史都保存下来

GPT-2 使用标准 Softmax Attention。生成一个新词时,模型会拿当前的 Query 与前面所有 token 的 Key 进行比较,再从 Value 中找出相关信息。

这就像写文章时,每增加一句话,都要重新翻阅前面的所有内容。

KV Cache 可以保存已经计算过的 Key 和 Value,避免重复计算,但它仍有两个问题:

  1. 上下文越长,KV Cache 占用的显存越大;

  2. 完整注意力的计算量随序列长度近似平方增长。

所以,当上下文扩展到几十万甚至一百万 token 时,传统注意力会变得非常昂贵。

三、Linear Attention:把历史压缩到一块“白板”里

线性注意力不再保存每个 token 独立的 Key 和 Value,而是把历史信息压缩进一个固定大小的状态矩阵。

可以把它理解为:

  • 标准注意力:保存整本原始笔记,需要时逐页查找;

  • 线性注意力:把笔记不断浓缩到一块固定大小的白板上。

这样做的好处是,生成新 token 时的状态大小不再随上下文长度持续增长,特别适合超长文本。

缺点也很明显:白板容量有限。内容越写越多,不同信息会相互覆盖和干扰,模型可能记得大意,却丢失精确细节。

四、DeltaNet:让模型学会“修改记忆”

普通线性注意力只是不断往白板上叠加内容,旧信息很难被精确修改。

DeltaNet 引入了 Delta Rule:

  1. 先用当前 Key 读取旧值;

  2. 比较旧值和准备写入的新值;

  3. 只写入两者之间的差异。

这就像数据库中的更新操作:不是在旧记录后面无限追加,而是定位原记录并进行修改。

由此,固定大小的状态不再只是一个累加器,而变成了可以更新的关联记忆。

五、Gated DeltaNet 与 KDA:让模型学会遗忘

DeltaNet 能修改特定记忆,但仍缺少主动清理旧信息的能力。

Gated DeltaNet 加入了遗忘门,可以让历史状态逐渐衰减。Kimi Delta Attention,也就是 KDA,又把这种遗忘机制细化到不同通道:

  • 有些信息可以长期保留;

  • 有些信息可以快速遗忘;

  • 有些关联可以被新事实精确覆盖。

这相当于模型不但拥有一块白板,还拥有了分区域、分优先级的自动擦除机制。

六、Kimi K3 为什么仍然保留传统注意力?

固定状态再聪明,也不可能无损保存一百万 token 的全部细节。因此 Kimi K3 没有完全抛弃 Softmax Attention,而是采用混合架构:

  • 69层 KDA:负责高速、低成本地维护滚动记忆;

  • 24层 Gated MLA:周期性回到原始上下文中进行更精确的全局检索。

可以把它理解为:

平时看压缩摘要,需要核对细节时再翻原始资料。

这才是 Kimi K3 架构的关键:它不是押注某一种注意力机制,而是在“快速记忆”和“精确回查”之间做工程平衡。

此前的 Kimi Linear 在特定百万 token 测试环境中,报告了最高约6倍解码加速以及最多75%的 KV Cache 降低;这些是特定模型、硬件和上下文条件下的“最高值”,不能理解成所有任务都会快6倍。Kimi Linear 官方项目

七、MoE:容量巨大,但不是每次全部运行

Kimi K3 的2.8万亿参数主要来自 MoE 专家系统。

模型面对不同 token 时,会调用不同专家。例如:

  • 代码内容交给更擅长代码的专家组合;

  • 数学推理调用另一组专家;

  • 普通语言、视觉或者工具操作又可能选择不同组合。

每次只激活16个路由专家和2个共享专家,因此它可以拥有巨大的知识容量,而不必让2.8万亿参数每次全部参与计算。

不过,未激活的参数虽然不参与本次运算,权重仍然需要保存和分布到大量设备上。即使按理想4bit计算,2.8万亿参数的原始权重也约需1.4TB,所以它仍不是64GB内存电脑能够本地运行的模型。

八、AttnRes:不仅向前查 token,也向上查“思考过程”

传统 Transformer 的残差连接,会把前面各层的输出不断相加。模型越来越深后,早期有价值的信息可能被大量后续输出稀释。

Attention Residuals(AttnRes)允许当前层根据输入内容,选择性地调用更早层的表示,而不是把所有层等权相加。

因此,Kimi K3 实际上在两个方向上管理记忆:

  • KDA和MLA解决“序列方向”的记忆:前面哪些 token 值得保留;

  • AttnRes解决“网络深度方向”的记忆:前面哪一层的理解最值得取回。

这相当于模型不仅能翻阅之前看过的资料,还能回到自己 earlier 的某一步分析结果。AttnRes 论文

九、需要注意的两个技术细节

第一,FlashAttention 并没有从数学上消除标准注意力的平方复杂度。它主要通过分块计算减少显存读写和中间矩阵占用,从而显著提速;真正改变序列长度复杂度的是线性注意力一类架构。

第二,Kimi K3 也不是“纯线性注意力模型”。它仍保留24层 Gated MLA,因此长上下文的精确检索能力并未被完全压缩成固定状态。它追求的是混合方案,而不是把所有历史都塞进一块有限白板。

总结

从 GPT-2 到 Kimi K3,技术演进可以归纳为三个问题:

  1. 存什么:从保存全部 KV,转向固定状态和稀疏专家;

  2. 怎么更新:从不断叠加,转向差分写入和选择性遗忘;

  3. 怎么检索:从逐 token 全量查找,转向滚动记忆、周期性全局回查和跨层检索。

所以,Kimi K3 最值得关注的并不是“参数达到 GPT-2 的22580倍”,而是它已经从一个单一的 Transformer,演变成了一套分层记忆系统:

日常使用压缩记忆,重要时回查原文;不同问题调用不同专家,必要时还可以返回早期思考层重新取回信息。

这可能也是未来大模型架构的重要方向:不再寻找一种包打天下的注意力机制,而是把快速记忆、精确检索、主动遗忘和稀疏专家组合成一个完整系统。