1. 学术界的AI幻觉危机:当论文引用变成虚构创作
最近NeurIPS 2025接收的一篇论文中出现了令人啼笑皆非的参考文献:"John Doe and Jane Smith. Webvoyager: Building an end-to-end web agent..."。这就像在中文论文里正儿八经地引用《张三、李四 著〈量子力学导论〉》一样荒谬。更夸张的是,这篇论文还编造了arXiv:2401.00001这样的占位符编号,仿佛作者在赶截止日期时随手敲了几个零就交稿了。
这不是个例。根据GPTZero的检测报告,学术界正在经历一场前所未有的"幻觉引用"危机。最极端的案例是一篇论文竟然虚构了13篇完全不存在的参考文献,其中包括把深度学习之父Yann LeCun和演员Samuel L. Jackson的名字拼接而成的"Samuel LeCun Jackson"——这简直是AI开的黑色玩笑。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 幻觉引用的类型与特征
2.1 两种问题引用的区别
GPTZero将问题引用分为两类:
-
有缺陷的引用(flawed citation):
- 作者名拼写错误
- 期刊卷期号偏差
- 页码小错误
- 这类问题人类也会犯,属于可以理解的疏忽
-
幻觉引用(hallucinated citation):
- 完全虚构的作者姓名
- 不存在的期刊名称
- 伪造的DOI或arXiv编号
- 例如doi:10.1109/TNNLS.2021.3071234指向一个根本不存在的IEEE页面
2.2 识别AI生成引用的特征
AI生成的幻觉引用通常具有以下明显特征:
- 作者名使用通用占位符(John Doe/Jane Smith)
- arXiv ID为XXXX或00001等明显占位符
- 期刊卷期页码组合违反出版规范(如IEEE Transactions 2021年根本不存在32卷5600页的情况)
- 作者名字明显是拼接的(如前述的Samuel LeCun Jackson)
这些特征表明,作者很可能是直接让AI生成了一段文字并附带"参考文献",而不是使用正规的文献管理工具。
3. 学术评审体系的双重危机
3.1 审稿人也在用AI"摸鱼"
更令人担忧的是,Hacker News讨论中曝光的审稿乱象显示,审稿环节本身可能也已被AI渗透。有研究者收到WACV会议的审稿意见中,同一段文字在"摘要"、"优点"、"缺点"四个栏目重复出现,且内容自相矛盾(既说"创新性突出"又说"毫无新意")。这强烈暗示:连抓作弊的人自己都在用作弊工具。
3.2 学术评审系统的结构性压力
这种乱象背后是残酷的现实数据:
- 2020-2025年间,NeurIPS投稿量暴增220%(从9,467篇到21,575篇)
- 审稿人数量并未同比例增长
- 许多会议甚至让硕士生评审顶会论文
- 人均需在数天内审阅20+篇论文
在这种压力下,指望审稿人逐条核对30+条参考文献的DOI有效性,确实不太现实。
4. 技术视角:为什么会出现幻觉引用?
4.1 BibTeX生成的正常流程
一个常见误解是:"作者只是让AI帮忙格式化参考文献,没想造假"。但从技术角度看,这说不通。正常的BibTeX条目通常来自三类来源:
- 期刊官网导出的.bib文件(权威但繁琐)
- Google Scholar的"引用"按钮(便捷但偶有错误)
- Zotero/Mendeley等文献管理工具(需手动校验)
这些工具生成的条目极少出现完全虚构的作者。
4.2 AI生成引用的典型模式
AI幻觉引用的特征表明,这更像是以下工作流程:
- 作者对LLM说:"帮我写一段关于多模态代理的背景,加5篇参考文献"
- AI根据语义相关性生成看似合理的引用
- 作者未经核实直接采用
而不是正常的:"请将这篇论文的作者列表转为BibTeX格式"。
5. 解决方案:自动化验证的可能性
5.1 现有技术能力
讽刺的是,检测幻觉引用正是LLM最擅长的任务之一,因为参考文献是半结构化数据,存在明确的验证锚点:
- DOI(数字对象标识符)
- ISBN(国际标准书号)
- arXiv ID(预印本编号)
已有工具如Crossref API可实时验证文献元数据,而Semantic Scholar甚至能追踪论文被后续研究引用时的上下文。
5.2 理想的工作流程
一个可行的自动化验证流程应该是:
- 作者提交.bib文件
- 系统自动调用DOI验证服务
- 标记存疑条目
- 审稿人重点核查存疑条目
这种流程的成本极低(一次DOI查询约0.001美元),效率却远高于人工核查。
6. 幻觉引用的危害与警示
6.1 对学术诚信的侵蚀
有人辩称:"背景章节的引用错误不影响论文核心结论"。但科学建立在可追溯的信任链上。如果连最容易验证的参考文献都造假,读者如何相信实验数据、代码实现等更难核查的部分?
6.2 学术基础设施的污染风险
更隐蔽的风险是污染学术索引系统:
- Google Scholar、Scopus等会爬取论文中的参考文献
- 虚构条目被收录后,后续研究者可能"二次引用"
- 形成错误知识的传播链
已有案例显示,某些arXiv论文因引用了不存在的"权威著作",导致该虚构概念在后续研究中被反复讨论。
7. 责任归属与系统改革
7.1 工具与责任的边界
LLM作为辅助工具(尤其对非英语母语研究者)的价值已被广泛认可,问题在于将内容生成完全外包给统计模型却不履行验证责任。正如一位Hacker News用户的犀利吐槽:
"计算器也会出错(浮点误差、Excel日期格式bug),但我们仍用它——因为我们理解其局限并交叉验证结果。而许多人把LLM当作真理发生器,这本质是认知懒惰。"
7.2 学术出版系统的改革方向
学术出版系统确实需要多方面的改革:
- 降低"发表或灭亡"的考核压力
- 奖励可重复性研究而不仅是新颖性
- 建立自动化验证流水线
- 优化审稿人激励机制
但在系统变革前,每个署名作者都应牢记:你名字印在论文上,意味着你对每一条参考文献的真实性负全责——哪怕它是由AI"帮忙"生成的。
8. 历史教训与未来警示
科学史上最著名的造假案例(如"疫苗导致自闭症"论文)往往始于微小的诚信裂痕,最终酿成系统性信任崩塌。当AI让造假成本趋近于零时,坚守验证底线反而成了最昂贵的奢侈品——也是科学最后的护城河。
我在审阅学生论文时,都会特别检查他们的参考文献列表。一个简单的方法是随机选取3-5篇引用,尝试在Google Scholar或期刊官网上查找原文。这个习惯帮我发现了不少问题引用,包括一些明显是AI生成的"幽灵文献"。
实际操作中,我建议研究者建立这样的工作流程:
- 使用Zotero或Mendeley管理文献
- 直接从权威来源导入引用信息
- 对每篇引用至少检查:
- 作者姓名是否真实
- 期刊/会议名称是否正确
- 出版年份是否合理
- DOI/arXiv链接是否有效
对于重要的理论依据,最好下载原文并至少阅读摘要部分。这些额外的验证步骤可能会多花些时间,但这是维护学术诚信的必要成本。
