美国地方媒体诉微软OpenAI版权案:6家出版商索赔数十亿,版权法能否撬动大模型

2026年10月2日,美国联邦密西西比州地区法院受理了一起具有里程碑意义的版权诉讼案。埃默里奇报业集团(Emmerich Newspapers)等6家地方出版商正式对微软及OpenAI的10个关联实体提起诉讼,指控后者系统性抓取并使用其受版权保护的新闻内容训练大模型,索赔金额高达数十亿美元。这场官司不仅是地方媒体与科技巨头之间利益的博弈,更可能成为美国版权法能否约束大模型训练的分水岭。

六家出版商联手,诉讼规模创同类案件之最

此次诉讼的原告阵容包括埃默里奇报业(密西西比州最大私营报业集团,业务覆盖路易斯安那州和阿肯色州)、Ojai Media(旗下《Ojai Valley News》创刊于1891年)、Coopwood Publishing Group(含《密西西比商业期刊》和《Delta Magazine》)等6家机构。这些机构在其服务的许多市场是唯一的新闻来源,诉讼称若此类媒体被迫缩减,美国地方社区的信息获取渠道将直接受损。

与此前《纽约时报》诉OpenAI案不同,此案原告的独特诉求在于:不仅要求经济赔偿,更要求法院依据《版权法》第503(b)条下达禁令,强制被告从所有GPT模型及其训练数据集中删除原告的注册作品——这在版权诉讼史上尚无先例。

版权管理信息被系统移除:原告的核心证据

诉状中最具技术细节的指控落在版权管理信息(Copyright Management Information,CMI)上。原告指出,其文章原本嵌入了作者署名、出版机构名称、版权声明和使用条款等内容,这些信息相当于作品的”身份证”。诉状称,被告在将内容投入训练之前,有意移除了这些标识,构成对《数字千年版权法》(DMCA)第1202条的违反。

原告的证据链还包括模型输出端的比对分析。诉状第98段引用了由原告律师团队技术顾问完成的分析报告:在开源数据集OpenWebText(WebText的近似复现)中,发现了来自原告网站的”数千条记录、数百万token的文本”。该分析同时指出,在Common Crawl数据集中,也有”数万篇原告受版权文章、数千万token内容”被识别。

绕过付费墙:技术行为还是法律侵权?

诉状详细描述了被告的抓取行为:称其”系统性、秘密地爬取原告网站内容,包括付费墙后的文章”,并将内容反复复制到自有服务器,”随着模型更新不断重复这一过程”。原告认为,被告的商业模式建立在对原创内容的无偿占用之上——”微软和OpenAI已经并将继续创造数十亿美元收入,内容生产者却连一分钱都没得到”。

这一指控与《纽约时报》案的路径高度一致,但地方媒体案的影响力在于其覆盖范围:这些独立报纸往往在本地市场具有垄断地位,其报道内容直接影响社区居民的日常生活,信息价值不容忽视。诉讼还特别指出,OpenAI曾在公开场合抱怨竞争对手用其生成内容训练模型——这与当前被指控的行为形成了鲜明对比。

法律路径与判例走向:2026年诉讼时间线

本案由法官Henry Travillion Wingate主持审理,案号为3:26-cv-00791。2026年10月5日,法院仅完成了诉状提交、传票签发和版权/专利/商标通知三项记录,距离开庭尚有距离。

值得关注的是,同一法官席位的《纽约时报》诉OpenAI案已进入总结判决阶段(交叉动议于2026年9月4日提交),预计在未来数月内作出裁决。如果NYT案在合理使用问题上对出版商有利,本案将获得强有力的先例支撑;如果OpenAI在NYT案中赢得全面胜利,地方媒体案的版权理论基础将受到严重冲击。

行业影响:版权诉讼对AI发展的深层挑战

版权诉讼对大模型厂商的核心威胁在于损害赔偿的计算方式。美国版权法对蓄意侵权最高可判处每件作品15万美元的法定赔偿。若原告成功证明数万篇作品被使用,赔偿金额对任何公司都非小数目。更关键的是”从模型中删除”的禁令请求——如果法院支持,这意味着模型需要重新训练或进行后处理去污染,在技术层面几乎不可行。

与此同时,美国司法部已在NYT案的法庭之友陈述中表明立场:禁止用版权内容训练AI可能阻碍技术进步。这一论调为OpenAI提供了联邦政策层面的支持,也为未来的监管博弈埋下伏笔。对大模型厂商而言,合规化的版权授权谈判或许是一条比诉讼更可持续的出路。

关键数据对比

维度 埃默里奇案 纽约时报案
立案时间 2026年10月2日 2023年12月27日
案号 3:26-cv-00791 1:23-cv-11195
原告类型 6家地方出版商 大型全国性媒体
核心诉求 赔偿 + 从模型中删除侵权数据 赔偿 + 禁制令
审理法官 Henry Travillion Wingate Sidney Stein
当前阶段 诉状提交完成 交叉总结判决阶段
法定赔偿上限 每件$150,000 每件$150,000

FAQ

美国地方媒体诉微软OpenAI的案件,与之前《纽约时报》诉OpenAI案有什么本质区别?

核心区别在于原告规模和诉求侧重点。时报案代表全国性大型媒体的版权利益,而地方媒体案聚焦于美国社区级报纸的生存困境——这些媒体往往在本地市场具有唯一性,其关闭直接影响信息获取。更关键的是,地方媒体案提出了”从GPT模型中删除侵权训练数据”的禁令请求,这在版权诉讼中前所未有,技术可行性存疑但法律姿态激进。

如果原告胜诉,对大模型厂商意味着什么?

赔偿层面,6家出版商若能证明数万篇作品被使用,按每件最高15万美元法定赔偿计算,总金额可达数十亿美元。禁令层面更危险:法院若支持从模型中删除的请求,意味着要么重新训练(成本极高),要么对模型参数进行后处理(技术难度大)。这将迫使大模型厂商加速推进版权授权谈判,而非继续以”合理使用”抗辩。

欧盟《数字单一市场版权指令》第17条对AI训练数据有什么规定,与此案有何关联?

欧盟第17条要求平台在发现侵权内容后立即删除,与美国的诉讼路径不同。但此案的核心在于训练数据抓取行为的合法性——美国厂商若在欧盟市场运营,仍需遵守第17条的”通知-删除”机制。长远来看,AI训练数据的版权合规将成为全球监管的共同课题,美国法院的判例将影响全球标准的制定方向。

小结

美国地方媒体诉微软OpenAI版权案,是2026年AI版权战场上值得关注的一场持久战。其独特之处不仅在于索赔规模,更在于”从模型中删除”这一前所未有的禁令请求。原告将技术层面的”记忆化”(memorization)问题与法律层面的版权侵权直接挂钩,为版权法如何应对大模型时代提供了新的解题思路。案件的走向将取决于总结判决阶段法院对”合理使用”四要素的裁量——而无论结果如何,大模型厂商都必须认真对待来自内容创作者群体的利益诉求。

相关阅读: