
Anthropic 的盗版书训练集体诉讼案,终于画上了句号。从 2024 年 8 月立案,到本月 20 日尘埃落定,这场拉扯了近两年的官司,最终以法院批准 Anthropic 向原告支付 15 亿美元和解金收场。
这数字听着就让人头皮发麻。即便不看那些虚高的年度经常性收入(ARR),仅参考路透社此前的报道,Anthropic 在 2023 至 2025 这两年间,实际营收总额也才不过 50 亿。这一刀,算是精准切中了动脉。出血量如此巨大,Anthropic 作为首个吃下这种级别罚单的 AI 公司,无疑是给同行们敲响了警钟。
世超第一时间调阅了判决书,发现细节里藏着不少看点。而这一切的根源,还得从 Anthropic 自己递出的那把“刀子”说起。
早在 2021 年 12 月,Anthropic 曾发表一篇论文,披露其早期大模型的训练数据来源,主要包括从 Common Crawl 抓取的网页数据以及网络书籍。当时,引用区里一个叫 The Pile 的数据集格外引人注目,因为其中包含一个名为 Books3 的子集。
Books3 收录了近 20 万本无版权电子书,可以说,几乎所有主流大模型都曾将其纳入训练库。如今,Books3 已彻底下架,成为行业心照不宣的秘密。但在当时,Anthropic 尚处于学术研究阶段,版权方顶多先拿小本本记上一笔。
真正将 Anthropic 推上风口浪尖的,是 2024 年媒体对企业使用 The Pile 训练模型展开的大规模调查。面对记者追问,Anthropic 发言人不得不承认,商业模型 Claude 确实使用了包含侵权内容的 The Pile 进行训练。
这下版权方彻底坐不住了:你非法抓取我的作品,靠训练出的模型获利,甚至可能抢走我的饭碗,结果我却连一分钱都分不到?
于是,三名作家代表数十万版权人,向 Anthropic 发起了诉讼,造就了这起史上规模最大的 AI 版权纠纷。
随着案件进入审理阶段,原告获得了深入调查 Anthropic 内部的机会。结果令人咋舌:相比于 Books3 里的几十万本书,这里还有 LibGen 和 PiLiMi 等来源,加起来至少有七百万本非法下载的无版权书籍。
与此同时,案件中有一个槽点满满、却唯独合法的操作浮出水面:花费数百万美元收购纸质书,去皮切页,进行破坏性扫描以构建数据库。
2024 年,Anthropic 或许意识到了用盗版书训练模型的法律风险,转而采取购买纸质书的方式。这些书被扫描入库制成数据集后立刻销毁,且数据集仅限公司内部用于模型训练,严禁外传。
这种做法恰好契合美国版权法中的“首次销售原则”——只要完成了首次购买,后续如何处置均由买家决定,前提是不能产生新的副本。
若上升到人类文明传承的高度,Anthropic 本无需做得如此极端。Google Books 早有先例,扫描完整图书且保留原件,法院仍认定为合理使用。但为了规避法律风险(更可能是因为破坏性扫描成本最低、最便捷),Anthropic 选择将书籍拆解成纸页直接送入扫描仪。
一边呼吁控制 AI 发展速度,一边停不下扫书毁书训模型的手,这种两面派做法,被 Anthropic 演绎得淋漓尽致。
消息曝光后,舆论瞬间爆发。相关讨论帖在社交媒体上的浏览量突破两千万,评论区骂声不断,近四千楼都在宣泄不满。
多位专家学者纷纷发声谴责,认为 Anthropic 的做法极其不地道。谁也无法保证被销毁的书里没有珍稀孤本。有二手书商在接受采访时透露,其库存中不乏罕见、绝版或外语书籍,部分被销毁的书,可能就是市面上仅存的几本。
更何况,许多书籍本身即是艺术品。Anthropic 将其内容数字化并封存,岂非意在独占人类文明?
一时间,“历史罪人”与“知识垄断商”的帽子,双双扣在了 AI 头上。连马斯克也没忍住,出来踩了一脚。
更具讽刺意味的是,这个唯一合法的操作,反而向法官证明 Anthropic 精通版权法。既然清楚如何规避风险,那么此前下载盗版书的行为,便是明知故犯,罪加一等。
坏事做尽,终遭反噬。
目前,案件已进入最终判决后的上诉期。在被侵权作品中,已有 91.3% 的作品完成申领。若判决顺利执行,每本书可获得 3000 美元的和解金。
值得注意的是,在这场天价官司中,获利最丰厚的竟是原告律师。起初,律师要求提取和解金的 20%,即 3 亿美元。法院认为金额过高,将其削减至 1 亿美元。即便如此,世超仍觉离谱——一场官司赚到的钱,恐怕抵得上普通人一辈子没见过的身家。
当然,尽管 Anthropic 已被各方狠狠教训,但这大概率不是它支付的最后一笔版权费用。不少放弃集体诉讼的版权方,仍在单独与 Anthropic 对簿公堂。
此次判决,为所有尚未结案的 AI 版权纠纷树立了标杆。没有漫长的法庭拉锯,也没有对科技巨头的偏袒,法院判决果断干脆。大家先拿到赔偿金再说,拖延下去对谁都没好处。
截至今日,Anthropic 盗版书集体诉讼案暂告一段落,但 AI 与版权的争议远未终结。
AI 是否可以在不打招呼的情况下,利用真人创作者的作品进行训练?
如果 AI 生成的内容复刻了真人作品的风格与表达,是否构成侵权?
一旦确认为侵权,责任该由谁来承担?
我们究竟该如何在 AI 发展与人类权益之间,寻找平衡点?
比起超级智能、灾难性风险、人类长期福祉等宏大命题——这些问题即便签署一百份协议也难以解决——Anthropic 不如回头看看,在这场无人愿意主动退出的 AI 竞赛中,有哪些问题可以摸着良心先去解决。
撰文:莫莫莫甜甜
编辑:江江 & 面线
美编:素描
图片、资料来源:
路透社、X、404 media、arxiv、
https://storage.courtlistener.com/recap/gov.uscourts.cand.434709/gov.uscourts.cand.434709.680.0_5.pdf