本文提出三正交轴分类框架,系统梳理 LLM 记忆机制从隐式到显式的演进,并指出记忆正成为模型架构的一等设计维度。
📝 详细摘要
文章由 PaperAgent 发布,基于清华唐杰团队与 NUS、Bosch AI 的综述,首次以架构为中心建立 LLM 记忆的统一分类学。它将注意力缓存、Mamba 类循环状态、测试时训练(TTT)、MoE 路由及 Engram 式查找存储等看似无关的技术,放入表征(隐式/显式)、更新动态(离线/在线)、持久性(短期/长期)三正交轴中进行比较。文中详细阐释了隐式记忆(注意力作为可微分内容寻址工作记忆、稀疏/选择性准入控制、循环序列记忆的状态压缩与权衡)和显式记忆(参数化模块如 Titans、TTT-E2E、In-Place TTT、MEMORYLLM/LM2;查找式记忆如 kNN-LM、Engram、PlugLM;MoE 作为离线显式记忆;多时间尺度更新的快慢权重谱系)。随后讨论系统层面的混合架构(层间交错、固定预算混合、自适应混合路由如 AMOR、HAM)、记忆管理(压缩、虚拟化、结构化稀疏作为架构问题)以及评测维度(容量、保真度、持久性、抗干扰、效率)。全文通过丰富的图表和表格,提供了当前最全的记忆架构编年表,并指出记忆正从 Scaling 的副产品转变为一等架构设计维度,对下一代 LLM 形态具有深刻影响。
💡 主要观点
- 提出三正交轴(表征、更新动态、持久性)分类框架,统一隐式与显式记忆机制。 任何记忆机制均可在此三维空间中定位,便于比较注意力缓存、Mamba 类状态、TTT、MoE、Engram 等技术的异同与设计权衡。
💬 文章金句
- 记忆正在从 Scaling 的副产品变成一等架构设计维度
- 三条轴基本正交:显式记忆可以离线(MoE)也可以在线(Titans);在线记忆可以短期(滑动窗口注意力)也可以长期(Mamba)。
- 显式记忆的定义性属性不是实现形式,而是自主性:存储的信息独立于即时计算图存在,可以被独立于标准前向传播的机制更新、访问和维护。
- MoE 本质上是一种离线显式记忆
- 记忆库是架构组件,不是工程外挂。
📊 文章信息
AI 初评:88
来源:PaperAgent
作者:PaperAgent
分类:人工智能
语言:中文
阅读时间:15 分钟
字数:3690
标签: LLM, 记忆机制, 架构分类, 注意力, Mamba