1. 论文概述:Engram条件记忆模块的创新与价值
这篇论文由DeepSeek团队提出,针对当前大语言模型在知识检索效率方面的核心痛点,创新性地设计了Engram条件记忆模块。作为一名长期关注语言模型架构演进的研究者,我认为这项工作的突破性主要体现在三个方面:
首先,它提出了"条件记忆"这一全新的稀疏化维度,与现有的条件计算(MoE)形成互补。在传统Transformer架构中,模型缺乏原生的知识检索机制,不得不通过计算来模拟检索过程——这就像用高级编程语言实现哈希表功能,虽然可行但效率低下。Engram通过引入O(1)复杂度的静态查找操作,从根本上改变了这一局面。
其次,论文揭示了MoE与Engram之间的U型缩放定律。通过大量实验证明,将约20-25%的稀疏参数预算分配给Engram记忆模块,能够获得最佳性能表现。这一发现为模型容量分配提供了重要指导。
最后,Engram在系统实现上展现出独特优势。其确定性检索模式支持内存与计算的解耦,使得超大规模嵌入表可以卸载到主机内存,而推理延迟几乎不受影响。这种设计突破了GPU显存对模型规模的限制。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 核心问题与Engram解决方案
2.1 当前大语言模型的效率瓶颈
现有大语言模型面临三个关键效率问题:
-
知识检索的低效性:模型需要消耗多个注意力层和前馈网络层来逐步组合特征,以识别简单实体或固定表达。如表3所示,识别"Diana, Princess of Wales"这样的实体需要层层特征组合,而理论上一个查找操作就能解决。
-
MoE架构的局限性:混合专家模型虽然通过条件计算扩展了容量,但所有参数都用于动态计算,缺乏专门的静态知识存储机制。
-
模型深度的浪费:大量计算资源被用于重建静态模式,挤占了本应用于复杂推理的有效深度。
2.2 Engram的架构设计
Engram模块的核心创新体现在四个关键设计上:
2.2.1 基于哈希N元语法的稀疏检索
-
分词器压缩:通过规范化处理(NFKC、小写化等)将语义等效的词符映射到相同ID,有效减少23%的词汇表大小。例如"Apple"和"uapple"会被映射到同一规范ID。
-
多头哈希:采用K个不同的哈希头处理每个N元语法阶数,使用轻量级乘法-XOR哈希函数减少冲突。公式表示为:
code复制e_{t,n,k} = E_{n,k}[φ_{n,k}(g_{t,n}) mod M_{n,k}]
2.2.2 上下文感知门控机制
为解决静态嵌入可能存在的噪声和多义性问题,Engram设计了注意力风格的门控:
- 使用当前隐藏状态h_t作为查询
- 检索到的记忆e_t作为键和值来源
- 通过RMSNorm稳定梯度后计算门控标量α_t
python复制# 伪代码示例
q = RMSNorm(h_t) @ W_Q
k = RMSNorm(e_t) @ W_K
v = e_t @ W_V
α
