1. 案件背景与核心争议点解析
2026年3月13日,Encyclopaedia Britannica(大英百科全书)与Merriam-Webster(韦氏词典)在纽约曼哈顿联邦地区法院对OpenAI提起诉讼,这场诉讼标志着AI版权争议进入全新阶段。与以往AI版权案件不同,本案不仅涉及训练数据的使用授权问题,更将矛头直指AI生成内容的署名权和来源标注问题。
作为在知识产权领域深耕多年的从业者,我认为这起案件的特殊性在于它同时开辟了三条法律战线:首先是训练数据的使用合法性,其次是模型输出的近似复现问题,最后也是最关键的——AI系统对传统知识品牌署名权的"挪用"。这三个层面的争议相互交织,构成了一个前所未有的复杂法律迷宫。
提示:本案最值得关注的创新点在于,原告首次将"错误归因"作为独立诉由提出。这意味着即使AI没有直接复制原文,只要将错误信息标注为"根据大英百科",就可能构成对商标权和商誉的侵害。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 案件的三重法律战线分析
2.1 训练数据的版权争议
根据起诉书披露,OpenAI被指控在未经授权的情况下使用了近10万篇大英百科和韦氏词典的内容用于训练GPT系列模型。这些内容不同于普通网页信息,具有三个显著特征:
- 高度结构化:百科条目和词典释义都经过严格的编辑体系整理,具有明确的分类体系和内在逻辑
- 商业价值明确:这些内容本身通过订阅、授权等方式产生直接收益
- 创作成本高昂:每个条目的编写都需要领域专家投入大量时间精力
从法律实务角度看,这类内容的特殊性使得"合理使用"抗辩面临更大挑战。我在处理类似案件时发现,法院通常会考虑四个因素:
- 使用的目的和性质(是否商业性)
- 版权作品的性质(创造性程度)
- 使用的数量和实质性
- 对潜在市场的影响
2.2 输出内容的近似复现问题
原告提供了多组ChatGPT输出与原文近乎逐字对应的示例,这触及了生成式AI最敏感的法律神经——模型到底是在"学习"还是在"记忆"?根据我的办案经验,这个问题可以从三个技术层面分析:
- 参数规模与记忆能力:现代大模型的参数量(如GPT-4据传有1.8万亿)使其理论上可以存储大量原文
- 训练数据的重复曝光:高质量内容在训练集中往往被多次采样
- 提示工程的引导:特定形
