1. 研究背景与核心发现
这篇获得ICLR 2026 Oral Presentation的论文揭示了一个突破性发现:大规模语言模型(LLMs)在纯文本预训练过程中,竟然自发形成了对视觉概念的隐式表征能力。我们团队通过设计精妙的探测实验发现,当模型规模超过100B参数时,在没有任何显式视觉信号输入的情况下,模型内部产生了与人类视觉皮层相似的概念表征结构。
这个发现挑战了传统多模态学习的范式——过去我们认为必须通过图像-文本对齐数据才能让模型"看懂"世界。而实验数据表明,单模态的文本预训练就足以让模型建立对三维空间、物体属性和简单物理规律的认知框架。比如在完形填空任务中,GPT-5能准确预测"放在倾斜桌面上的____会滑落"应该填入"玻璃杯"而非"地毯"。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 关键实验设计与验证方法
2.1 概念探测框架
我们开发了一套零样本概念探测框架,包含三个验证维度:
- 属性关联测试:测量模型对"红色-苹果"/"红色-消防车"等关联的敏感度
- 空间关系测试:评估"上方/下方/包含"等空间关系的编码质量
- 物理推理测试:检验对"易碎/可折叠/液态"等物理属性的理解
测试使用的prompt模板经过严格控制,确保不泄露视觉线索。例如物理属性测试采用:
"如果我说'小心别打碎那个____',最可能填入的词是?选项:A)石头 B)气球 C)玻璃杯"
2.2 模型架构对比
我们在相同数据量下对比了不同架构的表现:
| 模型类型 | 参数量 | 视觉先验得分 |
|---|---|---|
| 标准Transformer | 10B | 0.21 |
| MoE架构 | 100B | 0.63 |
| 递归增强架构 | 300B | 0.87 |
关键发现:模型容量与视觉先验能力呈超线性增长关系,且稀疏化专家模型(MoE)在概念分离方面表现突出。
3. 潜在机制的理论解释
3.1 文本描述的视觉信息密度
通过对训练语料的统计分析,我们发现描述性文本中隐含着丰富的视觉线索:
- 物体属性词(颜色/形状/材质)出现频率达23.7%
- 空间关系词每
