AI为何要“焚书”?这背后隐藏着怎样的秘密?

财云财经阅读:37652026-08-15 19:30:00评论:0
摘要: 2026年,Anthropic的“巴拿马计划”曝光,批量采购旧书销毁以获“干净”训练语料,引发全球关注。AI公司追着旧书“杀”,背后产业链和法律问题值得深思,也引发对知识数字化与公共化的思考。

巴拿马计划”浮出水面

AI公司的惊人之举

2026年7月,Anthropic与图书作家们15亿美元版权和解协议敲定,“巴拿马计划”曝光。该公司斥资数千万美元,批量采购2022年前出版的纸质书,切除书脊、高速扫描后粉碎销毁,只为获取未经AI“污染”的训练语料。此行为引发全球舆论哗然。

法院裁定与舆论反应

美国联邦法院裁定这一做法属于“合理使用”,消息传出后舆论沸腾。马斯克要求旗下团队保存珍贵书籍并采用无损扫描。国内图书行业也有行动,部分书籍版权信息页标注禁止用于AI训练,而国内对AI训练数据来源监管较宽松。

AI为何要“焚书”?这背后隐藏着怎样的秘密?

AI公司为何毁书

训练数据被污染

过去大模型训练语料多来自互联网,生成式AI爆发后,大量AI生成内容涌入,污染了公共语料库。用AI生成内容训练模型会导致“模型塌缩”,所以2022年之前的纸质书成了“黄金数据”。

纸质书的独特优势

2022年之前出版的纸质书在物理层面不可能包含AI生成内容,是纯净的人类原生语料。AI公司为获取这些“干净”数据,搭建起全球性隐秘采购链,引发旧书商关注。

隐秘的产业链

异常的采购订单

世界各地旧书商收到异常买书订单,全部夜间下单,采购书籍小众且多年无人问津,下单人阔气,运费高昂且预付。书商们怀疑这些订单与AI训练有关。

中间商与保密协议

书籍元数据平台ISBNdb作为中间商,为AI实验室匿名批量采购书籍,还提供保密协议。产业链曝光后,ISBNdb删除相关页面,否认推出此类服务。

15亿美元和解的舆论风暴

法官的裁决理由

法官在Bartz诉Anthropic案中裁决,使用合法购买的图书训练大模型属于合理使用,从盗版网站下载图书训练AI则构成侵权。Anthropic同意支付15亿美元和解金。

舆论发酵与行业行动

此裁决引发舆论热议,马斯克采取行动,国内图书行业也有举措,如部分书籍标注禁止用于AI训练,但国内对AI训练数据来源监管仍待加强。

知识数字化不等于公共化

文献数字化的现状

大量有学术价值的文献仍未数字化,更多文献数字化能让知识进入公共空间。但书籍进入大模型后被拆解,知识数字化未必能实现公共化。

市场派的观点

乐观的市场派认为真正挑战是缺乏有效共享和利用数据的基础设施,市场机制会解决大模型训练数据问题,然而人们也需思考知识最终服务的对象。

AI为何要“焚书”?这背后隐藏着怎样的秘密?

相关问答

“巴拿马计划”是怎么回事?

Anthropic公司的“巴拿马计划”,斥资采购2022年前纸质书,销毁以获“干净”训练语料,引发全球关注,法院裁定其属“合理使用”。

为什么AI公司要采购旧书?

因互联网语料被AI生成内容污染,2022年前纸质书是纯净原生语料,能避免“模型塌缩”,所以被AI公司视为“黄金数据”。

旧书商发现了哪些异常订单?

订单夜间下单,采购书籍小众冷门、毫无关联,买家阔气,运费高昂且预付,书商怀疑与AI训练有关。

法官对Anthropic案是如何裁决的?

法官裁定Anthropic合法购买图书训练大模型属合理使用,从盗版网站下载图书训练AI构成侵权,Anthropic需支付15亿美元和解金。

知识数字化与公共化是怎样的关系?

大量文献未数字化,更多文献数字化能让知识进公共空间,但书籍进大模型后被拆解,知识数字化未必能实现公共化。

市场派对于大模型训练数据问题有什么看法?

市场派认为真正挑战是缺乏有效共享和利用数据的基础设施,市场机制会解决大模型训练数据匮乏问题。

声明

转载声明:欢迎分享本文,转载请保留出处!

本文网址:https://www.caiair.cn/post/ai-fenshu-banama-jihua-439974.html

上一篇:

下一篇:

排行榜