硅谷的AI巨头们又开始“买买买”了,但这次买的不是算力芯片,也不是数据标注服务,而是珍本图书。最近《每日电讯报》和404 Media接连爆料,说AI公司正在大量收购珍本图书,然后——撕碎了当素材用。就问你,这事儿听着是不是比AI写诗还魔幻?
先别急着骂街。事情的起因很简单:扫描珍本图书这事儿,机器真干不了。互联网档案馆2021年就说过,自动化扫描对脆弱的古籍来说就是一场灾难,干净干燥的人手至今仍是唯一靠谱的翻页方式。该机构的老员工Eliza Zhang,干了十几年,也就扫了300多万页、14000张折页和18000件物品。你算算,这效率,AI公司要是靠这个喂模型,怕不是要等到GPT-100才能攒够语料。
所以,逻辑链条就这么出来了:AI公司需要海量文本,珍本图书扫描太慢,那就直接买原书,撕了拍张照,完事儿。404 Media甚至挖出一个叫ISBNdb的图书数据库公司,明晃晃地宣传自己能帮AI公司“大量获取图书”。2025年的图书侵权诉讼里,Anthropic内部那个“Project Panama”项目也被抖了出来,说是要扫描数百万册图书。往好听了说,这是为了扩充训练语料;往坏了说,这不就是现代版“焚书坑儒”吗?
但你要是真信了这套,那就天真了。Anthropic和马斯克的xAI都公开否认销毁过珍本图书,而且人家说得也在理:真要烧书,何必花大价钱买孤本?直接去图书馆偷拍不香吗?再说了,AI公司要的是文本内容,不是纸张本身,撕了书能提取什么?难道还能把油墨里的碳原子喂给神经网络?
不过,珍本图书零售商们的反应倒是挺有意思。爱尔兰书店Kennys最近接到一笔订单,一口气要买5000本冷门图书,买家连价都不还。这种订单放在以前,店主得乐开花,现在却吓得赶紧标记为“可疑”。为啥?因为真正收藏珍本的人,通常是一本一本地淘,哪有成批量买冷门书的?这操作,要么是图书馆采购,要么就是AI公司的“数据收割机”在行动。
说白了,这场风波本质上是AI行业数据饥渴症的又一次集中爆发。过去几年,大模型公司把互联网上的公开文本都快薅秃了,现在开始盯上纸质书这块“处女地”。但问题是,珍本图书的存量就那么多,你买一本少一本,真要是被AI公司批量收购销毁,那人类文化遗产就成了一堆训练数据——这买卖,怎么看都不划算。
当然,也有冷静的声音指出,目前没有任何实锤证据证明AI公司销毁过珍本图书。Anthropic的声明写得冠冕堂皇,xAI也信誓旦旦。但你要知道,AI公司连版权法都敢踩,连《纽约时报》都敢惹,销毁几本古籍算个啥?再说了,就算他们真烧了,你又能拿他们怎样?法律诉讼?等官司打完,书早化成灰了。
这事儿最荒诞的地方在于,AI公司明明可以走正规渠道——比如跟图书馆合作、购买数字版权、甚至雇佣人手慢慢扫描。但他们偏不,非要走“买书撕书”这种野路子。往好听了说,这是效率至上;往坏了说,这就是技术霸权对文化遗产的傲慢。就问你,一个连珍本图书都舍得撕的公司,你还指望它对人类文明负责?
说到底,图书零售商们的怀疑不是空穴来风,但真相可能比“销毁”更让人心寒——AI公司根本不在乎这些书的“珍本”属性,它们只是把书当成一堆待处理的文本原料。在这个逻辑里,莎士比亚的初版和超市促销手册没有本质区别。所以,下次你再看到AI公司宣布“收购海量图书用于训练”,别急着鼓掌,先想想那些书的下场。毕竟,当人类文明的载体变成数据饲料,我们失去的,可不仅仅是几本旧书。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。