1. 项目概述:海马体启发的语言模型序贯编辑框架
在自然语言处理领域,大语言模型(LLMs)的知识更新一直是个棘手问题。想象一下,当你需要修正百科全书中的某个词条时,传统方法相当于把整本书重新印刷一遍——这就是当前全量重训练(full retraining)的困境。模型编辑(Model Editing)技术应运而生,它像使用修正带一样,只修改特定知识而不影响整体。但现有方法在连续多次编辑后,模型会出现"记忆混乱":新知识记不住,旧知识又忘不干净,最终导致模型性能全面退化。
我们团队从神经科学中获得灵感,发现人脑海马体恰好完美解决了类似问题。海马体中的三突触回路(Trisynaptic Pathway)能同时实现:1)快速形成新记忆 2)防止相似记忆干扰 3)主动遗忘过时信息。基于此,我们开发了类海马体序贯编辑框架(Hippocampal-like Sequential Editing, HSE),其核心创新在于将生物记忆机制转化为机器学习算法。
关键突破:HSE首次实现了编辑过程中的"选择性记忆"——既能像海马体一样快速吸收新知识,又能避免不同知识间的相互干扰,同时主动清理记忆"垃圾"。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 核心机制解析
2.1 机器遗忘:知识的新陈代谢系统
传统编辑方法最大的问题是"只增不删",就像不断往仓库堆货却不清理过期物品。HSE设计了基于非似然损失(Non-likelihood Loss)的主动遗忘机制:
python复制def forgetting_loss(original_logits, edited_logits, target_labels):
# 计算新旧知识冲突程度
conflict_mask = (original_logits.argmax() != edited_logits.argmax())
# 仅对冲突部分施加遗忘惩罚
loss = -torch.log(1 - F.softmax(edited_logits[conflict_mask], dim=-1))
return loss.mean()
该机制通过三个步骤工作:
- 冲突检测:比较编辑前后模型对同一输入的预测差异
- 选择性擦除:仅降低与新知识直接冲突的旧知识权重
- **
