训练大模型期间,人工智能巨头Anthropic在提升数据录入效率上,采取了一项让公众咋舌的行动——他们处理了上百万本实体书籍。
2024年7月20日,根据当地报道,Anthropic和一群作家达成了15亿美元和解协议,此判决获得法院批准,创下了美国版权法史上和解金额的最高记录。不过,比起天文数字般的和解款项,Anthropic内部的一个隐秘计划反而更让人议论纷纷。
法庭公开的文件显示,这家公司从2024年初便启动了代号“巴拿马计划”的项目。Anthropic动用了数千万美元,向二手书商批量购置书籍,随后通过“破坏性扫描”手段处理这些书籍。操作流程是将书脊切割开,单页内容被扫描进数据库,处理完毕之后纸张便被销毁。据估算,已有200万册实体书在这过程中遭毁。
AI企业对高质量训练数据的渴求是此举的根源。相较于互联网上充斥的低质内容,甚至不乏AI生成的内容,经过作者精心创作、编辑审核及出版流程筛选的书籍,堪称大型语言模型的宝贵知识源泉。破坏性扫描方案能在效率上更优,且成本更低,这使得它备受青睐。
尽管法院认定Anthropic通过合法Purchase途径购买书籍用于大模型训练属于“合理使用”,但这种损毁书籍的做法,依旧引发了广泛的质疑和反对。
作家集体诉讼案,最终揭露了Anthropic的“毁书计划”
“巴拿马计划”的细节曝光,源自一场针对作家的集体诉讼。
2023年,美国恐怖小说家安德莉亚·巴茨偶然发现自己的作品出现在了Anthropic等AI公司广泛使用的训练资料库中。巴茨认为,自己投入心血创作的成果,竟被AI公司用来构建他们价值数十亿美元的产业。2024年8月,她联合其他作家,在美国作家协会协助下,对Anthropic提起了集体诉讼。
随着司法介入的深入,Anthropic的数据获取方式逐渐浮出水面。如今备受争议的“破坏性扫描”,实际上是该公司在面临法律压力后,采取的一种成本更高的数据采集手段。
法院文件指出,为了获得优质训练数据,Anthropic最初曾通过收集盗版电子书来构建数据库。
去年6月,法官裁定该公司将逾700万本盗版书籍保存在一个“中央数据库”中,此行为侵犯了作家权益。但与此同时,也确认了Anthropic利用合法途径购买书籍训练模型,是对作家作品的“合理使用”。
因此,违法的是盗版,而非破坏性扫描。
今年7月,Anthropic与一批作者达成了高达15亿美元的和解协议。协议规定,每一本符合条件的书籍版权所有人平均能获得约3000美元赔偿。这起持续两年的版权争议案件,至此有了阶段性解决。
“破坏性扫描”,争议不止于法律层面
尽管AI模型训练可被视为对书籍的“合理使用”,并得到了法院的认可,但“破坏性扫描”这一行为引发的争论已经超出了法律范围。
最大的担忧集中在珍贵书籍可能在过程中遭受不可逆转的损害。尽管目前没有确切证据表明Anthropic的项目已经破坏了具有特殊价值的古籍,但考虑到涉及书籍的数量巨大,公众仍然忧虑部分珍贵的历史文献和绝版书籍可能已被纳入AI训练供应链。
对于AI企业来说,书籍的价值仅在于其录制的文本数据。在扫描过程中,它们未必能区分稀有孤本与普通书籍的差异。然而,对于书商、收藏家、文献研究者以及历史研究者来说,实体书籍不仅是知识的载体,其纸张、装帧、批注以及流传痕迹都承载着数字化内容无法替代的历史意义。
当然,也有观点支持AI企业对书籍的大规模扫描。这些观点认为,较之让大量未受关注的旧书静置无人问津,通过AI系统让其重新加入人类知识体系,或许是更好的选择。
不过,AI企业的书籍数字化与公共机构推行的文化保护存在根本区别,扫描产生的数据最终将流入









网友评论