最近,不少从事二手书生意的人发现,接到了数额非常大的订单,而且书籍种类十分繁杂。这些书商推测,或许是有人工智能企业急于获得大量未遭AI污染的文本,用来提升语言模型的效果。
▲一个用于Anthropic公司“巴拿马计划”的二手书仓库
全球书商遭遇反常订单
位于英国诺森伯兰郡的巴特书店老板斯图尔特·曼利,通常每周能卖出两三千本二手书。但最近,一家加拿大公司下达的一笔订单,就抵得上他一周的销量。斯图尔特表示,自己从业30年,还从未经历过这种情形。
美国休斯顿的贝克书店经理查理·贝克也遇到了同样的事情。他透露,最近卖给了同一个客户95本书,其中有一笔交易就涉及70本书。这些书的主题大多是非虚构类,出版年份集中在20世纪70年代到90年代,比如一本1995年出版的《丹佛都市区内幕指南》。
爱尔兰的肯尼斯书店也曾接收到5000本书的订单。订单中包含地区历史书籍、18世纪非洲农具书籍、20世纪50年代赛车手传记以及一些非常小众的金融指南,几乎看不出什么主题规律,像是机器自动生成的清单。
因此,书商们开始推测,这些买家或许并非普通读者,而是借助自动化系统,根据国际标准书号(ISBN)搜寻尚未被AI覆盖过的书籍。
三个月前,有人在知名社交平台上发问:“为何近期网上二手书抢购热潮如此之盛?”很快,帖子下涌现出大量书商的回应,他们纷纷讲述了收到异常大量订单的经历。
不过,不少买家其实是中间商,并非AI公司。位于加拿大的Zoom Books声称自己是“北美顶尖的图书回收商”,每年通过“智能物流”处理超过200万册图书。全球许多书商,包括德国、新西兰等地,都曾接到过这家企业的订单。
荷兰的书商们也收到了新加坡一家名为“2077AI”的机构发来的邮件。该机构声称正在“革新人工智能数据”,其部分工作就是建立训练数据集。邮件附件中,附有一份包含3000种英文书籍的清单,如《地质力学中的离散元建模》这类学术书籍。
出版行业内部对此现象非常关注。一名匿名的英国二手书商说,尽管订单来自不同买家,但都被寄往同一个地址。自1月以来,他陆续收到这类订单达6000本,价值数千英镑。虽然买方批量采购,但出价“非常可观”,并未要求打折。
书商们猜测,这些人工智能公司可能在购入书籍后,扫描其内容再将其销毁。
2025年,三位作家起诉人工智能公司Anthropic后,美国法官裁定,购买书籍用来训练人工智能软件并不违反版权法。理由是这些模型以“变革性”方式处理书籍,AI训练过程类似于教师指导小学生写作。
法庭文件显示,Anthropic曾耗资数千万美元,收购数百万本书籍,拆除书脊,扫描书页,以此训练语言大模型Claude。该项目在公司内部被称为“巴拿马计划”。参与拆书的书籍范围很广,包括拉丁文文献和西部牛仔小说。
Anthropic回应称,通过书籍采集数据是人工智能行业普遍采用的方法,公司的数据采集项目不会“购买并销毁珍贵古籍”。
另一起案件中,Anthropic被发现从盗版网站下载大量电子书用于模型训练。在此诉讼中,公司并未承认违规,而是同意向出版商和作者支付15亿美元的和解金。书籍被下载的作者可以申请获得赔偿,预计每本书约获3000美元。
专家指出,当前人工智能公司面临的数据难题,部分是自身造成的:开放网络中充斥着AI生成的文本,若用这些“垃圾”数据训练新模型,恐怕会导……










网友评论