8月17日消息,外媒404 Media公布的一项追踪调查显示,亚马逊正通过大批购入纸质书籍、扫描内容用于训练AI模型,并在扫描过程中直接销毁原书。调查人员将苹果AirTag藏入一批珍贵书籍的货件中,追踪其在美国境内的运输路径,最终确认货件抵达亚马逊位于拉斯维加斯的一座仓库。
该仓库内设有一支名为VGT3的团队,标志为一只手拿书本的霸王龙。据员工透露,为提高扫描效率,团队会先切掉书脊,原书因此在处理过程中被毁。扫描所得数据随后被用于训练亚马逊自有的Nova模型。亚马逊发言人在回应中称,公司通过正常商业渠道采购书籍,用于改进产品。
部分书商怀疑,AI公司正尝试按照ISBN编号系统性地逐本扫描已出版书籍。纸质书的价值在训练数据层面尤为突出,因为大量内容从未出现在互联网上,且许多书籍出版于2022年以前,不含AI生成内容,具备较高的数据纯净度。
采取类似做法的并非只有亚马逊。Anthropic此前也曾开展过同类项目,相关细节在图书作者提起的一起诉讼中被披露。该诉讼文件显示,Anthropic内部存在名为“巴拿马计划”的项目,公司从电商平台购入书籍,切除书脊后将内容数字化。审理该案的法官裁定,此类扫描属于合理使用,不构成版权侵权,裁决依据之一为纸质原件已被销毁,不存在原书复制后再出售的情况。
亚马逊和Anthropic都在将部分珍贵书籍转化为企业私有的AI训练材料。争议在于,一些被毁掉的原书可能根本无法替代,原本能够留在公共书架上的知识也随之消失,最终只被封存在单一公司的封闭AI模型内部。这一做法引发的版权与知识保存问题,正在成为AI训练数据来源领域的新焦点。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。