1. 残差连接的困境与突破
残差连接(Residual Connection)作为现代深度学习的基石技术,自2015年ResNet提出以来,已经成为各类神经网络架构的标准配置。在Transformer模型中,残差连接更是承担着保障梯度流动、维持信息传递的关键角色。然而随着模型规模的不断扩大,这一看似完美的设计逐渐暴露出其固有缺陷。
传统残差连接采用固定权重(通常为1)的简单累加方式,将每一层的输出直接叠加到原始输入上。这种设计在浅层网络中表现良好,但当网络深度达到数十甚至数百层时,信息稀释效应开始显现。具体表现为:深层网络的梯度信号逐渐减弱,早期层的关键特征在多次累加后被噪声淹没,模型难以有效利用全部网络深度。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. AttnRes的核心创新
2.1 深度维度的注意力机制
Kimi团队提出的Attention Residuals(AttnRes)方案从根本上重构了残差连接的工作机制。其核心思想是将Transformer中成功的注意力机制移植到深度维度,使每一层能够动态选择性地聚合前面各层的信息,而非简单累加。
与传统残差连接的固定权重不同,AttnRes为每一层引入可学习的注意力权重,这些权重具有以下特性:
- 输入依赖性:根据当前输入特征动态调整
- 层间差异性:不同层可以关注不同的历史信息
- 归一化约束:通过softmax保证权重总和为1
2.2 关键技术实现
2.2.1 查询-键-值设计
AttnRes沿用标准的注意力机制框架,但在具体实现上做了精心优化:
- 键(Key):使用前面各层的输出作为键,无需额外计算
- 值(Value):同样复用各层的原始输出
- 查询(Query):采用极简设计,每层仅引入一个d维可学习向量
这种设计在几乎不增加计算量的前提下,实现了深度维度的动态信息路由。
2.2.2 稳定性保障
为避免幅值差异导致的注意力失衡,AttnRes引入两项关键设计:
- RMSNorm归一化:对各层输出进行幅值归一化
- Softmax约束:强制模型在不同层间进行明确取舍
3. 工程优化与实现
3.1 Block AttnRes设计
Full AttnRes虽然理论完美,但在实际部署时面临显
