1. 论文核心发现与背景解析
Transformer架构自2017年问世以来,已成为大语言模型(LLM)的事实标准。但鲜为人知的是,这种架构在特定序列任务上存在理论限制。我们团队通过系统实验发现:即便经过海量数据预训练,Transformer仍无法突破某些根本性的架构约束。这个发现对当前"越大越好"的LLM发展范式提出了重要质疑。
在GitHub代码补全等实际场景中,我们常遇到这样的现象:模型能完美补全右侧代码,却对左侧已有内容"视而不见"。这种不对称表现正是Transformer架构固有特性的体现。通过精心设计的检索与复制任务家族(包含4种变体),我们首次量化验证了预训练模型存在的方向性偏差:
- 正向检索(查询token右侧内容)准确率高达98.7%
- 反向检索(查询token左侧内容)准确率骤降至62.3%
- 在非唯一性任务中(如重复出现的变量名),两种方向表现均不足50%
关键发现:预训练数据量可以改变偏差程度,但无法消除架构本身的限制。这就像给汽车装上更强的引擎,却改变不了轮胎抓地力的物理极限。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 实验设计与理论框架
2.1 任务家族构建
我们设计了包含12,800个样本的合成数据集,涵盖四种核心任务类型:
-
唯一正向检索(Unique-Induction)
- 输入:"A=1 B=2 A=?"
- 预期输出:"1"(检索最近左侧的A值)
-
非唯一正向检索(NonUnique-Induction)
- 输入:"A=1 A=2 A=?"
- 预期输出需考虑全部历史
-
唯一反向检索(Unique-RevInduction)
- 输入:"?=A 1=B 2=A"
- 预期输出:"2"
-
非唯一反向检索(NonUnique-RevInduction)
每种任务设置5种长度变体(16-1024 tokens),使用C-RASP[pos]框架确保理论可解释性。这个框架的关键在于将Transformer操作形式化为数学表达式,例如:
code复制Attention_Score(i,j) = softmax(Q_i·K_j/√d)
Position_Encoding(pos) = [sin(pos/10000^(2i/d)), cos(
