|
【案例】 文化野蛮行径:人工智能企业正在摧毁全球藏书
克里斯・斯托克尔 - 沃克(Chris Stokel-Walker) 发布时间:2026 年 7 月 30 日
在哈勒姆历史老城区,彼得・德弗里斯(Pieter de Vries)经营的古董地图与古籍书店里,时间仿佛近乎停滞。这位 60 岁的荷兰书商专营古地图、插画与版画,不少藏品溯源至 16、17 世纪,同时他的珍本书副业也经营得有声有色。 他的馆藏之中,有一部 1558 年出版的罗马史著作;来自 17、18、19 世纪的游记;珍贵的初版书籍;各类博物学典籍。直到不久前,店内还藏有限量版《海格罗夫植物图谱》(The Highgrove Florilegium)—— 这套两卷本精美图册收录格洛斯特郡海格罗夫庄园(Highgrove House)花园内各类植物,由当时的查尔斯王子亲笔签名。 平日里,这位书商平均每天只能卖出一本书,进店客流始终寥寥无几,偶尔才有电话响起。正因如此,德弗里斯在 6 月中旬收到一封邮件时倍感蹊跷,邮件附带一份约 3000 种书目清单。 发件人自称“娜塔莉(Nataly)”,隶属于一家名为 2077 人工智能(2077AI)的公司。娜塔莉写道:“我们正在开展新项目,搜集多语种图书,目前以英文书籍为主。我们整理了一份庞大的待采购书目(详见附件),计划大批量采购。” 德弗里斯不敢点开附件里的表格,认定这是一场骗局。“珍本书行业里,很少有人一次性采购超过一册书,” 他说,“所以突然有人说要买几百本你的藏书,实在反常。” 然而这并非骗局,事态远比骗局更令人不安。此事是硅谷为增强人工智能算力开展的又一项惊人行动。德弗里斯很快得知,今年全球数百位珍本书商都收到了同类询价,这些采购方代表加州科技巨头,在全球范围内大肆收购二手图书。 这些图书随后被送入高速扫描设备:机器切下书脊,扫描完成后将原版书页粉碎、制成纸浆。科技新闻网站 404 媒体(404 Media)本周曝光了这项秘密计划,项目初衷是训练新一代人工智能模型。消息一出,社交媒体网友无不惊骇于这项行动的规模。 据 404 媒体报道,一家名为 ISBN 数据库(ISBNdb)的服务商可承接一次性采购多达一百万册图书的订单,其中包含存世量寥寥无几的珍本。一名 X 平台用户本周评论道:“那些历经战火、火灾、数百年流转留存下来的书籍,如今惨遭粉碎,只为让人工智能学会写出更优质的营销邮件。” 埃隆・马斯克(Elon Musk)也表达了忧虑。他在 X 平台发帖称:“我已经要求太空探索技术公司(SpaceX)人工智能团队妥善保存馆藏珍本,采用无损方式扫描,而不是直接切断书脊扫描。” (配图说明:2023 年 6 月 16 日,法国巴黎凡尔赛门展览中心举办国际科技创新展,太空探索技术公司、特斯拉首席执行官,X 平台所有者埃隆・马斯克出席活动并做出手势。 埃隆・马斯克对数字化进程中珍本书籍遭到损毁一事表达担忧。图片来源:贡萨洛・富恩特斯(Gonzalo Fuentes)/ 路透社) 这项计划的伏笔早在两年前埋下。2024 年 2 月,知名人工智能对话模型克劳德(Claude)的开发企业安索柏(Anthropic)聘用谷歌图书(Google Books)前高管汤姆・特维(Tom Turvey),交给他一个目标简单却震撼世人的任务:获取 “全世界所有书籍”。安索柏希望扩充人工智能模型的知识库,海量图书能够满足模型庞大的数据需求。 马尔卡尔・丰特・伊・埃斯皮(Marçal Font i Espí)在巴塞罗那郊外几公里的巴达洛纳经营二手书店,同时担任巴塞罗那大学文学讲师。他认为人工智能企业已经撞上所谓 “数据壁垒”:互联网充斥人工智能生成的劣质文本,模型开发者日渐缺少新鲜的人类原创素材。他表示,想要持续优化模型,企业依旧需要 “人类创作的内容”。 加盟安索柏之前,特维负责谷歌图书扫描项目的合作事务,但他在新公司主导的图书项目思路截然不同。公司要求他尽可能扫清各类“法律、实操与商业阻碍”(引自安索柏内部通讯),收购全球存量旧书。 上月,加州一家法院就安索柏使用图书训练模型是否需要向作者支付报酬一案公布裁决文件。文件显示,特维上任初期,仅草草向出版商发送几封邮件,洽谈图书用于人工智能训练的授权事宜,随即放弃这条路径,转而直接对接图书经销商与零售商,大批量采购实体书。 安索柏总共投入数百万美元批量购书,利用液压裁切机器撕下书页、与封皮分离,扫描完成后直接销毁图书。扫描设备本身并非必须损毁书籍才能读取内容,但销毁实物能够巩固安索柏在法庭上的有利地位。法官裁定:通过数字化扫描提取书籍内容,随后彻底销毁实体书,并不构成版权侵权;数字版本“取代” 实体版本,该行为属于转化性使用,而非复制行为,因此不受著作权法约束。 (配图说明:2023 年 7 月,安索柏首席执行官达里奥・阿莫代伊(Dario Amodei,最左侧)在美国参议院人工智能监管听证会上宣誓作证。 图片来源:索尔・勒布(Saul Loeb)) 美国这条奇特法律条文的源头,可以追溯到早年围绕图书数字化展开的诸多博弈。简单来说,此前版权持有人极力维护自身权益,迫使人工智能企业唯有销毁原版书籍,才能合法利用书中内容。 加州这项判决催生一种经济导向:人工智能企业更愿意收购二手闲置图书,而非和出版商协商版权授权。除了书籍本身遭到损毁之外,这一现状引发版权保护人士强烈抗议。创作权益组织公平训练(Fairly Trained)创始人埃德・牛顿 - 雷克斯(Ed Newton-Rex)直言:“当下这件事或许合法,但很多人认为法律本不该允许这样做。” 他曾深耕人工智能行业,长期公开批评人工智能产业对待版权作品的方式。他提出,购入实体书本不该自动赋予企业使用书中内容训练商用模型的权利。 牛顿 - 雷克斯表示:“如果你只花 1 美元购入一本二手书,钱款全部流入图书批发商手中,难道就有权依托这本书训练商用生成式人工智能模型,让模型与原著作者形成竞争?我和许许多多的人都认为答案是否定的。” 安索柏拒绝就此发表评论。 与此同时,大量民众无法接受实体图书遭到销毁,人工智能企业显然心知肚明。依附大批量旧书采购需求诞生的配套行业,全程笼罩在迷雾之中。ISBN 数据库在官网博文写道:“舆论风险真实存在。‘人工智能企业销毁两百万册图书’绝非能够博取大众同情的新闻标题。”(ISBN 数据库一名发言人向《每日电讯报》证实这项服务确实存在,但称其只是测试,“用来调研市场需求,这项服务最终并未正式上线”。) (配图说明:人工智能巨头安索柏致力于搜罗“全世界所有书籍” 图片来源:菲利普・霍利斯(Philip Hollis)) 丰特・伊・埃斯皮最先察觉异样,他的书店接连收到异常订单,不少订单的运费远超图书本身价值。目前没有证据表明这些订单来自 ISBN 数据库。据他了解,德国、法国、西班牙、新西兰的二手书商都遭遇了同类情况。 牛顿 - 雷克斯认为,企业刻意保密的行为本身就耐人寻味。“显然图书供货方和人工智能企业都清楚这件事观感极差,不愿细节公之于众。” 涉及图书扫描与销毁的诉讼文书里,除原告提及的书目之外,不会列明其他书籍名称,但 404 媒体称其中包含大量珍本。德弗里斯表示,他认识的荷兰古董书商都没有接单,但他认为专业性较弱的普通二手书商可能选择交易。“经营二手书的商家数量众多,我相信有大量图书被运走。” 在丰特・伊・埃斯皮看来,最严峻的风险在于企业收购某部冷门著作仅存的可流通孤本。 著作权法不会区分印量数百万册、封面磨损的《哈利・波特》平装本,和仅存五册的冷门古籍。康奈尔大学数字与信息法学教授詹姆斯・格里梅尔曼(James Grimmelmann)说:“著作权法并不看重原始版本与实体文物。无论一本书印了五百万册还是五册,法律一概将其视作一份复制品。” 丰特・伊・埃斯皮着重说明,他并不反对数字化本身。“我不排斥人工智能。我明白书籍与古老知识需要转化为全新载体,” 他说道,但目标应当是 “规范完成数字化,而非毁掉原始文献”。 牛顿 - 雷克斯则认为,无论书籍存世量高低,这件事的本质没有区别。“生成式人工智能时代,没有任何画面比这更能体现这项技术背后的掠夺本质:市值近万亿美元的大企业,花几美分或是一美元收购书籍,扫描数据、用于模型训练,随后将书本销毁,实质上吞噬人类文明。” 即便当前行为合乎法律,硅谷内部也并非所有人都认可这种对待书籍的方式。人工智能企业工厂人工智能(Factory AI)首席执行官马坦・格林伯格(Matan Grinberg)写道:“机械化销毁承载人类私密情感的读物,透着一种极端漠视人性的冷漠。无论出于何种理由,历史向来不会善待焚书之人。” 正如书商德弗里斯所言:“这是一种野蛮行径…… 形同焚书。”
来源:镜况 编辑:邓雨轩
|