Anthropic「巴拿马计划」曝光!数百万旧书被切脊喂给ASI

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
Anthropic「巴拿马计划」曝光!数百万旧书被切脊喂给ASI
8577点击    2026-08-23 11:25

Anthropic「巴拿马计划」曝光了!


Anthropic「巴拿马计划」曝光!数百万旧书被切脊喂给ASI


2024年4月13日,Anthropic内部传阅了一份文档。


里面有这么一句:我们用一个「软代号」,因为不想让人知道我们在做这件事。


代号叫巴拿马计划(Project Panama),这件事,是破坏性扫描全世界所有的书。


Anthropic「巴拿马计划」曝光!数百万旧书被切脊喂给ASI


两年后,秘密曝光,这句话彻底失效了。


2026年1月,法官下令解封四千多页诉讼文件,外媒直接把备忘录原文登了出来。


人类写的书籍


正被拆解为ASI的数据集


「巴拿马计划」真正疯狂的地方,其实不只是切掉了多少本书。


它正在把几百年来,人类写进书里的知识、经验和思想,一页页拆成下一代AI的训练数据。


Anthropic「巴拿马计划」曝光!数百万旧书被切脊喂给ASI


Anthropic「巴拿马计划」曝光!数百万旧书被切脊喂给ASI


一个作者花十年写下的一本书,一位学者穷尽半生整理出的知识,一整个时代留下的语言、观念和叙事,进入扫描流水线之后,都会被OCR、切碎、Token化,最终汇进模型的参数。


对于正在向ASI狂奔的硅谷大厂来说,书架其实是一座还没被彻底开采的「人类知识矿山」。


Anthropic「巴拿马计划」曝光!数百万旧书被切脊喂给ASI


尤其是2022年以前出版的纸书,经过作者、编辑、出版社层层筛选,长文本结构完整,又几乎没有AI生成内容污染。


互联网越被AI文本淹没,这批「纯人类语料」反而越稀缺。


所以,当Anthropic说要拿到「世界上所有的书」,它想收集的其实是一份尽可能完整的、人类文明训练集。


接下来发生的一切,也就顺理成章了。


一开始


Anthropic根本没打算买


2021年,公司成立第一年的Anthropic,压根没想过花钱买书。


联创Ben Mann先下载了Books3,约18.3万份;同年6月从LibGen拿走至少500万份;2022年7月,Pirate Library Mirror再拿至少200万份。


三笔加起来,超700万份盗版电子书。毕竟,拿,比买省事。


判决书里,CEO达里奥直言:本来有很多地方可以买,但走正规采购要面对一堆法务、实操和商务上的麻烦。


Anthropic「巴拿马计划」曝光!数百万旧书被切脊喂给ASI


2024年2月,Anthropic把Tom Turvey招了进来,任务便是拿到「世界上所有的书」,还得绕开那堆麻烦。


他没再谈授权,直接从图书分销商和零售商手里批量买货:数千万美元,数百万本,很多是二手的。


书运到之后是固定的三步。


液压切纸机削掉书脊,高速扫描仪把散页扫成可搜索的PDF,纸张进回收车。


判决书第15页写得很清楚:剥离装订、裁切书页、扫描,然后丢弃每一本纸质原件。


Anthropic「巴拿马计划」曝光!数百万旧书被切脊喂给ASI


斥资15亿美元,换来一张「通行证」


去年6月,法官William Alsup的判决把这件事拆成三块。


用书训练模型:合理使用。买来的纸书一对一转成不外传的数字副本:也是合理使用——一本进,一份出,原件已经销毁,副本总数没有变多。


从盗版站下载还永久留存,不受保护,为此Anthropic赔了15亿美元。


Anthropic「巴拿马计划」曝光!数百万旧书被切脊喂给ASI


判决书第15页:Anthropic及其供应商剥离装订、裁切书页,扫描后丢弃每一本纸质原件。


对照Anthropic现在9650亿美元的估值,这笔钱占0.16%。


更要紧的是它放行了什么:不是「切书」,是「买来的一本,换成一份」。原件必须消失,这套论证才成立。


也就是说,切,是这条链的承重墙,不是图省事。


硅谷大厂跟风


开始买旧书


过去十年,AI公司抢的是网页、代码、图片,抢完原件还在。


现在抢的是纸书,切一本少一本,最核心的因素是「干净」。


语料里最稀缺的是没被AI写过的字,行业里流行的说法是,2022年前出版的纸书不可能混进大模型生成的内容。


《华盛顿邮报》拿到的文件里还有一层:Anthropic偏爱纸书,是因为出版物文笔好,不带那股「低质量互联网腔」。


解封文件里另有一条采购要求:优先买「不那么常见」(less common)的书。


不常见,往往就是绝版、印量小、市面难找。


需求烧到了大西洋另一头。


英国旧书商,最先感觉到了异常。他们这几个月是真赚到钱了。


Anthropic「巴拿马计划」曝光!数百万旧书被切脊喂给ASI


诺森伯兰郡Barter Books的Stuart Manley告诉BBC,他平时一周卖两三千本,最近一笔来自加拿大公司的订单,一单就抵得上一周。


干了30年二手书生意,他说没见过这种事。


今年7月,图书数据服务商ISBNdb挂页面对AI公司喊话:


世界上最好的AI训练数据正躺在书架上,可承接1000本到100万本的订单,为买家保密身份。


页面上还有一句自白:观感问题是真实存在的,「某AI公司销毁两百万本书」不是一个能博得同情的标题。


就在最新404 Media报道中,公布了另一条线。


Anthropic「巴拿马计划」曝光!数百万旧书被切脊喂给ASI


一位书商在旧书平台Biblio接到一笔约1000本的匿名订单,书目毫无关联,买家不还价。他在其中一本书里夹了一枚苹果AirTag。


追踪器从加州出发,最后停在拉斯维加斯的亚马逊LAS8设施。


那栋楼平时干的是按需印刷——有人下单,这里印一本新书发出去。


北端有块叫VGT3的区域,门上贴着一只霸王龙,爪子抠进书里。一名员工在内部论坛写:我们的任务就是扫书,有人负责切书,有人负责收货扫条码。


Anthropic「巴拿马计划」曝光!数百万旧书被切脊喂给ASI


亚马逊拉斯维加斯LAS8设施VGT3区域的入口标志,一只红色霸王龙爪子扣进书里。(图源:404 Media)


同一栋楼,南边印新书,北边毁旧书。


谁来负责把书留下来


同样是扫书,互联网档案馆的目的正好相反:不为训练,只为把书留下,让所有人都能读到。


它用的是Scribe扫描仪,一页一页人工翻。


他们试过机器人翻页,但对稀有书行不通,最后还是靠人手。


一位操作员十年扫了大约一万八千本书,是七十名Scribe工人中的一个。整个档案馆用了二十年,扫到第二百万本。


Anthropic「巴拿马计划」曝光!数百万旧书被切脊喂给ASI


互联网档案馆的Scribe扫描工作站,书放在V形托上,人工逐页翻拍。全球约70名Scribe操作员,一台一台这样干了二十年。(图源:Wikimedia Commons)


同样是扫书,亚马逊VGT3的流水线刚上了工时定额。


一边二十年扫了两百万本,一边恨不得一天清掉一卡车。


销毁与存留之间的速度差,十分刺目。


但真正的问题不在快慢,而在于切下去的是哪本书。


爱丁堡McNaughtan's书店的Derek Walker心中有一笔账。


一本只印了100册、其中75册已经进了图书馆的学术书,市面上确实罕见,但毁掉一本,谈不上多大的损失。


可他店里也卖出去过18世纪的某个版本,全世界只此一本。它们如果进了切纸机,性质完全不同。


Barter Books的Stuart Manley说得实在。


世界确实不再需要五百万本《达芬奇密码》,那些书堆在库房里二十年卖不掉,现在有人整批拉走,对他是好事。


但Walker卖出的18世纪唯一孤本,一旦切开就没了。


更可怕的是,AI公司只按ISBN收货,是畅销书还是孤本,对于它们并没有什么区别,在那些匿名订单里是不做区分的。


如果真有一本孤本进了切书机,我们大概率永远不会知道。


参考资料:


https://storage.courtlistener.com/recap/gov.uscourts.cand.434709/gov.uscourts.cand.434709.231.0_4.pdf 


https://www.bbc.com/news/articles/cp3rprx2wl4o


文章来自于微信公众号 “新智元”,作者 “新智元”

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI数据分析

【开源免费】DeepBI是一款AI原生的数据分析平台。DeepBI充分利用大语言模型的能力来探索、查询、可视化和共享来自任何数据源的数据。用户可以使用DeepBI洞察数据并做出数据驱动的决策。

项目地址:https://github.com/DeepInsight-AI/DeepBI?tab=readme-ov-file

本地安装:https://www.deepbi.com/

【开源免费airda(Air Data Agent)是面向数据分析的AI智能体,能够理解数据开发和数据分析需求、根据用户需要让数据可视化。

项目地址:https://github.com/hitsz-ids/airda