1. Engram:DeepSeek最新工作解读
最近DeepSeek团队在arXiv上发布了一篇题为《Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models》的论文,提出了一种名为Engram的新型记忆模块。作为一名长期关注大模型架构演进的技术从业者,我认为这项工作在模型稀疏化方向上开辟了新的思路。下面我将从技术背景、核心设计到工程实现进行全面解析。
Engram这个名字来源于神经科学中的"记忆痕迹"概念,有趣的是其核心设计确实借鉴了NLP中的N-Gram算法。这个模块的提出背景是:当前大语言模型(LLM)普遍存在"全参数激活"的低效问题——即使是处理简单查询也需要动用全部参数。DeepSeek团队此前已经在MLA(混合局部注意力)、NSA(神经稀疏注意力)和DSA(闪电索引器)等工作中探索了各种稀疏化方案,而Engram则从"记忆与计算解耦"的角度给出了新的解决方案。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 技术背景与核心动机
2.1 现有架构的局限性
传统Transformer和MoE(混合专家)架构都存在一个根本性缺陷:它们没有真正的记忆功能。所有"知识"都是通过参数间的交互计算隐式存储的。这就好比要求一个人每次被问到"中国的首都是哪里"时,都需要重新推导一遍答案,而不是直接回忆已知事实。
具体来看:
- 标准Transformer:每个token的处理都需要经过所有FFN层的矩阵乘法,即使处理"Hello world"这样的简单文本也要动用全部参数
- MoE架构:虽然通过专家路由实现了条件计算,但本质上仍是参数化的计算过程,缺乏显式记忆存储
2.2 人类记忆的启示
人类大脑处理语言时存在明显的分层机制:
- 基础词汇和固定搭配(如"United States")是直接回忆的
- 复杂推理(如解数学题)才需要真正的计算
- 中间层是语法规则等结构化知识
Engram的设计正是模拟这种分层处理机制,将"死记硬背"的内容剥离出来单独存储。论文中给出的一个典型案例是:当模型看到"United"时,后续出现"States"的概率极高,这类固定搭配完全可以通过记忆模块直接检索,无需每次重新计算。
