1. DeepSeek Engram技术解析:大模型稀疏化的创新路径
在自然语言处理领域,Transformer架构已经成为大语言模型(LLM)的基石。传统Transformer主要由注意力机制和前馈神经网络(FFN)两大模块构成,而近年来混合专家系统(MoE)的引入进一步提升了模型容量。DeepSeek团队最新提出的Engram模块,开创性地通过可扩展查找机制为Transformer注入了条件记忆能力,这可能是继MoE之后最重要的架构创新。
Engram的核心思想直击Transformer的一个本质局限:现有模型处理文本时,每个token的信息都需要通过注意力机制从头计算,而实际上连续token组合(N-gram)往往包含可直接利用的现成信息。这就好比人类阅读时,遇到"纽约"这样的固定搭配会直接调用记忆,而不需要每次都对这两个字重新分析。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. Engram架构设计与实现原理
2.1 模块整体架构
Engram模块采用了一种精巧的残差连接设计,在不破坏原有Transformer工作流的前提下增加记忆功能。具体实现上有几个关键特点:
-
选择性增强:并非在所有Transformer层都添加Engram,而是选择性地在中间层集成。实验表明,过早引入(如在第一层)效果不佳,因为底层尚未形成足够的语义表征。
-
双路输入:
- 主路径输入:来自上一层的hidden states(h_t),承载完整的上下文信息
- 辅助输入:原始token IDs,在推理时提前可知可实现计算优化
-
残差连接:Engram输出与原始输入相加,既保留原始信息流,又增加记忆功能
这种设计使得Engram可以无缝嵌入现有Transformer架构,不需要改变训练框架的基本逻辑。
2.2 N-gram信息提取机制
Engram最核心的创新在于它对N-gram信息的处理方式。传统N-gram方法面临组合爆炸问题——对于128K的词汇表,2-gram组合就达到163亿种可能。Engram通过三重技术方案解决这一难题:
- 语义压缩:
- 使用映射函数将原始token ID(x_t)压缩为x'_t
- 例如"Apple"和"apple"会被映射到同一ID
- 实验显示可减少23%的字
