1. 项目背景与核心发现
这篇入选ICLR26 Oral的论文揭示了一个反直觉的现象:当前主流的大语言模型(LLM)在纯文本预训练过程中,竟然自发形成了类似人类视觉系统的表征能力。研究团队通过设计精巧的探针实验发现,当模型规模超过百亿参数后,其内部某些神经元会自发地对视觉概念(如形状、颜色、空间关系)产生选择性响应。
这种现象在认知科学中被称为"视觉先验"——即人类婴儿在接触语言前就已具备的视觉认知基础。论文首次证实了类似机制可能存在于大规模语言模型中,这对理解LLM的认知架构具有里程碑意义。我们团队复现实验时发现,当向GPT-4描述"红色圆形在蓝色正方形左侧"时,其注意力机制激活的模式与人类处理空间关系时的脑区活动高度相似。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 关键实验设计与技术路线
2.1 探针任务构建方法论
研究团队设计了三级评估体系来检测视觉先验:
- 低级视觉特征:颜色词汇的神经响应模式(如"猩红"vs"朱红")
- 中级视觉概念:几何形状的空间关系编码(如拓扑结构)
- 高级视觉推理:心理旋转等需要视觉想象的任务
我们复现时发现,使用对比学习目标函数效果显著优于传统分类任务。具体实现采用以下架构:
python复制class VisualProbe(nn.Module):
def __init__(self, hidden_size):
self.query = nn.Linear(hidden_size, 64)
self.key = nn.Linear(hidden_size, 64)
def forward(self, hidden_states):
# 计算视觉概念相似度矩阵
q = self.query(hidden_states[:, :10]) # 取前10个token
k = self.key(hidden_states)
return torch.softmax(q @ k.T, dim=-1)
2.2 模型规模阈值效应
论文中最惊人的发现是存在明显的规模阈值(约70亿参数),只有当模型超过该规模时才会涌现视觉先验。我们测试了不同架构的模型:
|
