1. 论文核心发现:语言模型的同质化危机
这篇NeurIPS 2025最佳论文揭示了一个令人不安的现象:当代大型语言模型在开放式任务中表现出惊人的同质化倾向。研究者通过系统性实验证明,不同架构、不同厂商的模型在创意写作、头脑风暴等本应多元化的场景中,输出的内容语义相似度高达71%-82%。这种"人工蜂群思维"(Artificial Hivemind)现象意味着,表面上多样化的AI系统实际上正在形成思维模式的趋同。
关键发现:当要求25个主流模型生成"时间的隐喻"时,75%的回答集中在"时间如河流"和"时间如织者"两个模板上,展现出明显的模式坍缩(Mode Collapse)。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 实验设计与方法论突破
2.1 Infinity-Chat数据集构建
研究团队突破性地构建了INFINITY-CHAT数据集,这是首个专门针对开放式对话场景的基准测试集。其创新性体现在:
- 真实场景采样:从WildChat等平台收集真实用户与模型的交互记录,筛选出58%创意生成、15.2%头脑风暴等6大类17小类开放式问题
- 多维标注体系:每个query配备:
- 50个不同模型的生成结果
- 25位人类标注者的绝对评分(1-5分)
- 成对偏好标注(31,250组对比)
- 语义空间映射:使用text-embedding-3-small将回答嵌入向量空间,量化相似度
2.2 双维度同质化测量
2.2.1 模型内重复(Intra-model repetition)
在高随机性(temperature=0.9)设置下:
- 单个模型对同一问题生成50个回答
- 两两语义相似度平均超过0.8的占比79%
- 即使采用min-p解码策略,核心思路重复率仍达65%
2.2.2 模型间同质化(Inter-model homogeneity)
跨厂商模型对比发现:
- 商业文案任务中逐字重复率18.7%
- 手机壳创意描述出现"流畅设计,不妥协于功能"等完全相同的套话
- 不同架构模型(Qwen/LLaMA/Claude)在隐喻生成上语义重叠度达71%
3. 机制分析与理论贡献
3.1 训练数据瓶颈效应
研究发现当前主流训练数据存在:
- 网络文本同质化
