1. 剑桥大学DCR方法:AI创造力与准确性的平衡之道
在人工智能领域,我们长期面临一个根本性矛盾:模型越准确,创造力就越匮乏。这就像培养一个数学天才,当他精通所有标准解题方法后,反而失去了面对新问题的灵活思维。剑桥大学Max Ruiz Luyten和Mihaela van der Schaar教授团队的最新研究,为这个困扰行业多年的难题提供了突破性解决方案。
这项发表于2026年初的研究(arXiv:2601.00747v1)提出的分布式创造性推理(DCR)框架,从根本上重构了AI训练范式。不同于传统方法单纯追求正确答案,DCR通过精心设计的"多样性能量"函数,在数学上保证了模型既能保持高准确率,又能维持丰富的推理策略库。这种平衡对于实际应用至关重要——在医疗诊断中,我们需要AI给出准确结论,同时也希望它能考虑多种可能的病因路径;在创意写作中,我们希望AI既符合语法规则,又能展现独特的叙事风格。
1.1 传统方法的根本缺陷
当前主流的大型语言模型训练方法主要分为三类:STaR(自我训练推理)、GRPO(群组强化策略优化)和DPO(直接偏好优化)。通过深入分析这些方法的数学本质,研究团队揭示了它们导致创造力崩塌的内在机制。
STaR方法采用典型的"赢者通吃"策略。在实际训练中,当某个推理路径被证明有效后,系统会指数级加大其权重。这就像班级里第一个解出难题的学生会获得老师所有关注,导致其他学生放弃自己的解题思路。我们的实验数据显示,使用STaR训练的模型在5个epoch内就会将90%的概率集中在单一推理路径上。
GRPO方法看似公平,实则暗藏危机。它给予所有正确路径相同的奖励增量,理论上应该保持多样性。但就像生态系统中随机波动会导致某些物种意外消亡一样,训练过程中的小批量采样噪声会逐渐使某些策略被边缘化。我们的跟踪实验表明,经过20个epoch后,GRPO模型的策略多样性会衰减至初始值的30%左右。
DPO方法试图通过强制概率平均分配来维持多样性,但这种机械式的平均主义忽略了策略间的本质差异。好比老师要求每个学生必须使用不同颜色的笔解题,却不关心解题思路是否真正不同。量化分析显示,DPO模型产生的"多样性"中,有超过60%属于表面差异(如措辞变化),而非实质性的策略创新。
关键发现:现有方法都在不同程度上导致策略空间坍缩,其根本原因在
