1. 条件记忆与可扩展查找:大语言模型稀疏化的新维度
在2026年初发表的这篇开创性论文中,研究者们提出了一个颠覆性的观点:传统基于混合专家(MoE)的稀疏化方法只利用了条件计算这一单一维度,而通过引入"条件记忆"这一新维度,可以解锁大语言模型更高效的架构设计。这个发现犹如在深度学习领域投下了一枚震撼弹——当我们还在优化计算路径时,研究者已经将目光转向了记忆系统的重构。
Engram模块作为该研究的核心创新,其设计灵感源自神经科学中的记忆痕迹理论。不同于传统Transformer需要反复计算来模拟检索过程,Engram实现了真正的O(1)时间复杂度查找。这种设计突破让我联想到计算机体系结构中缓存机制的进化史——从全相联映射到直接映射,每一次寻址方式的革新都带来了性能的飞跃。Engram的精妙之处在于,它将N-gram这种经典语言模型概念与现代深度学习框架相结合,创造出了兼具高效性和表达力的记忆单元。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 稀疏分配问题与U型扩展定律
2.1 计算与记忆的权衡艺术
论文中提出的"Sparsity Allocation"问题揭示了模型设计中一个根本性的权衡:何时使用神经计算(MoE),何时依赖静态记忆(Engram)。通过大量实验,研究者发现了一个反直觉的U型扩展定律——并非简单地增加记忆模块就能提升性能,而是需要在计算与记忆之间找到最佳平衡点。
这个发现让我想起自己在优化模型时的亲身经历:曾经为了提升知识检索能力,盲目增加了外部记忆库的容量,结果反而导致整体性能下降。论文中的U型曲线完美解释了这个现象——当记忆模块过小时,无法有效分担计算负担;当过大时,又会引入不必要的参数冗余。研究者通过严格的控制变量实验,最终确定在27B参数规模下,Engram模块的最佳配置比例。
2.2 实现细节与工程挑战
具体实现上,Engram采用了一种创新的分层索引结构:
python复制class EngramLayer(nn.Module):
def __init__(self, vocab_size, embedding_dim):
super().__init__()
self.token_embedding = nn.Embedding(vocab_size, embedding_dim)
