三亩地 三亩地SAN MU DI · CODE DIARY
ARTICLE DETAIL

日记详情

真实记录编程学习的某一天,欢迎挑你感兴趣的翻一翻。

智谱清华唐杰:LLM Memory最新全景综述

智谱清华唐杰:LLM Memory最新全景综述

过去两年,记忆这个词在LLM圈子里被用滥了——KV Cache叫记忆,RAG叫记忆,Agent的向量库也叫记忆,Titans的测试时训练还叫记忆。每个人都在谈记忆,但没有人在同一个坐标系里谈

这篇来自清华唐杰(也是市值5800亿智谱创始人)、NUS和Bosch AI的综述做了一件吃力但必要的事:给LLM的记忆机制建立一个统一的、以架构为中心的分类学。它把从注意力缓存、Mamba类循环状态、测试时训练(TTT)、MoE路由到Engram式查找存储这些看似毫不相关的技术,全部放进同一个设计空间里比较。

本综述相对于代表性以记忆为中心的综述的定位。

读完你会有一个强烈的感受:记忆正在从Scaling的副产品变成一等架构设计维度——这可能比单纯堆参数更深刻地影响下一代模型的形态。

Figure 1:LLM记忆的演进——从隐式、短暂的计算副产品,到显式、持久、自适应的架构设计维度

一、三轴分类法:给记忆建坐标系

这篇综述的核心贡献是一个三正交轴分类框架。任何记忆机制,都可以沿这三条轴定位:

取值回答的问题
表征(Representation)隐式 vs 显式存的是什么?有没有独立的读写接口?
更新动态(Update Dynamics)离线 vs 在线什么时候更新?训练期还是推理期?
持久性(Persistence)短期 vs 长期信息能影响多久的计算?

三条轴基本正交:显式记忆可以离线(MoE)也可以在线(Titans);在线记忆可以短期(滑动窗口注意力)也可以长期(Mamba)。

论文的Table I 把45+个代表性系统按三轴逐一归类(从2017年的Transformer到2026年的Mamba-3、Engram、Kaczmarz Linear Attention),是目前我见过最全的一张记忆架构编年表

二、隐式记忆:计算动态中的工作记忆

Figure 3:隐式记忆总览——注意力作为内容寻址记忆(A)、稀疏/选择性/结构化记忆(B)、循环序列记忆(C)

2.1 注意力 = 可微分的内容寻址瞬时记忆

自注意力本质上是一个可微分的、内容寻址的工作记忆:历史token被编码为KV对,新token通过query按内容检索。它在线更新、访问灵活,但记忆是短期的、容量被上下文窗口锁死,且随推理结束即被丢弃。

两个值得注意的观察:

  • 上下文窗口扩大 ≠ 记忆能力变强。实证研究表明,长上下文模型经常用不满名义容量——理论记忆大小和实际利用率之间有鸿沟。
  • StreamingLLM 本质是隐式淘汰策略:滑窗+保留少量”注意力锚点”token,大部分历史被持续覆写。长程行为不是来自无限存储,而是来自精心设计的访问模式

2.2 稀疏与选择性:记忆的准入控制

稀疏注意力(Sparse Transformer、BigBird、Longformer)从记忆视角看,是在固定预算内重塑访问路径;MoBA、NSA更进一步,用学习到的路由替代固定模式,做块级记忆访问控制。Selective Attention则是准入控制——决定哪些token值得被放大。RATTENTION的发现很精炼:少量精心选择的全局记忆锚点,就能显著稳定长上下文推理。

统一视角:注意力记忆的扩展方式不是”存更多”,而是”更精细地控制准入、访问与保留”。

2.3 循环序列记忆:把历史压缩进状态

这是2024-2026年最拥挤的赛道,论文梳理得非常细:

  • 线性注意力与SSM主线:Linear Attention → GLA → Mamba/Mamba-2 →Mamba-3(复数MIMO状态空间,2026);RWKV系列演进到RWKV-7(向量门控广义delta规则)。
  • 状态编辑语义:Gated DeltaNet-2把”键侧擦除”和”值侧写入”解耦;Kaczmarz Linear Attention把写入建模为键归一化投影;Kalman Linear Attention引入不确定性感知的滤波更新。
  • KDA / Kimi Linear:通道级对角衰减 + 对角加低秩转移,是Kimi Linear的循环核心。
  • 层级状态容量:Log-Linear Attention用Fenwick树层级状态,在”恒定大小状态”和”全量KV存储”之间找到对数级中间地带。

循环记忆的代价也很明确:状态与计算耦合,缺乏灵活读写控制;长程压缩会损失保真度。

三、显式记忆:可寻址、可持久、可写

Figure 4:显式记忆总览——参数化外部记忆(A)、查找/检索式记忆(B)、条件参数与MoE(C)、多时间尺度嵌套更新(D)

显式记忆的定义性属性不是实现形式,而是自主性:存储的信息独立于即时计算图存在,可以被独立于标准前向传播的机制更新、访问和维护。

3.1 参数化记忆模块:推理时也能长记性

  • Titans:专用记忆模块在推理时通过”惊讶度驱动的梯度信号”逐token更新——只改记忆参数,不动骨干。
  • TTT-E2E:辅助参数子集在推理时对输入做端到端优化。
  • In-Place TTT:更激进——直接把FFN的down-projection矩阵当作可复用快权重记忆,在标准MLP块内部赋予自主写语义。论文因此提出一个重要判断:显式记忆不一定是一个独立的”记忆库”,也可以是一个被赋予写语义的静态参数矩阵。
  • MEMORYLLM / LM2:固定大小的持久记忆槽/记忆池,跨层嵌入,前向自更新。

解耦学习动态是这一路线的共同心法:骨干编码通用能力,记忆参数吸收上下文信息——缓解灾难性干扰,但带来容量、更新稳定性和过拟合瞬时信号的新权衡。

3.2 查找式记忆:存储与计算解耦

  • kNN-LM:外部持久datastore,跨推理调用存活——比KV Cache更”显式”。
  • Engram(2026):哈希寻址的稀疏记忆槽,把记忆稀疏性专家稀疏性明确分开——MoE稀疏激活的是”参数化变换”,Engram稀疏寻址的是”存储的记忆条目”。这个区分很关键:查找记忆不能被还原为条件计算。
  • PlugLM / ExplicitLM:可编辑记忆库,条目甚至是人类可读的token序列——让存储知识可检查、可定点更新。

论文特意划清了与RAG的边界:RAG靠外部编排管线,这里讨论的是嵌入模型结构的持久存储——记忆库是架构组件,不是工程外挂。

3.3 MoE = 参数空间里的条件记忆

这是全文视角最新颖的一节:MoE本质上是一种离线显式记忆。每个专家是一个持久的参数化记忆块,路由器就是在参数空间上做”上下文相关的寻址”。Mixtral的专家涌现专业化、DeepSeek-MoE的细粒度专家划分,都在强化这个解读:MoE实现的是模块化、可选择性访问的持久知识记忆

3.4 多时间尺度更新:记忆的时间维度

Nested Learning引入层级化更新频率——不同参数子集以不同速率演化,形成”快适应-慢适应”的连续谱,直接呼应经典的快慢权重分解。这触及了稳定性-可塑性两难:高频更新适应性强但易漂移,低频更新稳定但迟钝。时间控制与结构持久性同等重要。

三轴之外,论文还分解了记忆怎么写的五类机制,这是全篇最具工程参考价值的表格:

四、系统层:混合架构、效率管理与评测

4.1 混合架构:从固定配比到信号门控

  • 层间交错:Samba(Mamba+滑窗注意力)、Jamba(SSM-Attention混合块)、LightTransfer(把预训练Transformer的”懒惰层”替换为流式组件)、Priming(把混合化变成知识迁移问题)。
  • 固定预算混合:OLMo Hybrid、Kimi Linear、Hymba、Falcon-H1——注意力放在哪一层、哪个头,都是设计时静态决定的。
  • 新趋势:自适应混合路由AMOR只在高熵位置激活事后注意力精炼块;HAM让循环记忆处理每个token,只把”循环状态预测不好的token”准入稀疏KV缓存。核心问题从”注意力该插在哪”变成**“哪些token值得高分辨率存储”**——混合记忆从静态层布局变成动态资源。

4.2 记忆管理:不是工程事后补丁,而是架构设计轴

CommVQ(KV向量量化)、PagedAttention(KV分页虚拟化)、Bottlenecked Transformers(工作记忆周期性巩固覆写)、Memory Caching(缓存循环状态快照而非逐token KV)——论文的立场是:压缩、虚拟化、结构化稀疏,重塑的是记忆的表征、访问与扩展方式,这是架构问题,不是系统运维问题。

4.3 评测:记忆不是一个标量

NIAH、LongBench、RULER、L-Eval、SCROLLS各有分工,但论文批评现有协议把”记忆容量”和”推理能力、Scaling效应”混为一谈。它呼吁把记忆性能分解为正交维度:容量、保真度、持久性、抗干扰、效率——隐式和显式记忆需要不同的评测协议(前者看长程依赖与噪声稳定性,后者看更新一致性、检索精度与延迟)。

学AI大模型的正确顺序,千万不要搞错了

🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!

有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!

就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋

📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇

学习路线:

✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经

以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!

我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~

这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费

← 返回列表