1. 项目概述:Engram——大语言模型稀疏化的新维度
在当今大语言模型(LLM)的发展浪潮中,混合专家模型(MoE)通过条件计算成功扩展了模型容量,但其核心的Transformer架构仍存在一个根本性缺陷:缺乏原生的知识查找机制。这导致模型不得不通过昂贵的计算过程来模拟检索操作,例如解析一个多标记实体需要消耗多个浅层注意力机制和前馈网络,本质上是在运行时对静态查找表进行昂贵的重建。
Engram项目针对这一痛点提出了革命性的解决方案——条件记忆(Conditional Memory)。与MoE通过稀疏激活参数处理动态逻辑不同,条件记忆依靠稀疏的查找操作来检索固定知识的静态嵌入。这种创新架构将N元语言模型的经典思想进行现代化改造,实现了𝒪(1)复杂度的知识查找,为LLM稀疏性开辟了全新维度。
关键突破:Engram模块使模型能够直接访问静态知识库,而非通过计算重建知识。这相当于为Transformer配备了一个"外部记忆体",让浅层网络不必再浪费计算资源在琐碎的模式重建上。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 核心架构设计解析
2.1 整体架构概览
Engram作为条件记忆模块,通过将静态模式存储与动态计算在结构上分离来增强Transformer主干网络。如图1所示,其工作流程分为两个关键阶段:
- 检索阶段:提取并压缩后缀N元序列,通过哈希确定性检索静态嵌入向量
- 融合阶段:检索到的嵌入由当前隐藏状态动态调制,并通过轻量级卷积精炼
这种设计实现了计算与记忆的解耦——Engram不应用于每一层,而是策略性地放置在特定层(如第2层和第15层),既保证早期干预又避免过度干扰深层表征。
2.2 基于哈希N元的稀疏检索
分词器压缩技术
传统N元模型直接操作分词器输出,但标准子词分词器为语义等效术语可能分配不同ID。Engram通过预计算满射函数𝒫:V→V',将原始标记ID折叠为规范标识符。实测在128k词表上实现23%的有效压缩。
实现细节:
python复制def token_compression(original_id):
normalized_text = NFKC_normalize(lowercase(vocab[original_id]))
return canonica
