亚马逊被曝批量采购图书拆解扫描用于AI训练数据

印刷图书在扫描过程中会被销毁,这一流程意味着这些书籍在完成数字化转换后将不再作为实体物品存在。

科技媒体404 Media近日发布调查报道称,亚马逊正在内华达州拉斯维加斯的一处仓库内大规模接收印刷版图书,通过拆开书脊并快速扫描书页的方式将其数字化,而这一过程中图书本身会被销毁。报道指出,这些图书可能被用作人工智能模型的训练数据。

此次调查的起点是一本被怀疑会被AI公司收购用作训练数据的珍稀图书。调查人员在书中放置了苹果AirTag跟踪设备,最终追踪到该书的去向是位于拉斯维加斯的一个亚马逊仓库。在该仓库工作的亚马逊员工向404 Media证实,他们的工作内容是接收大量印刷版图书,拆开书脊后进行高速扫描,扫描完成后印刷图书即被销毁。

据员工介绍,这一仓库团队被命名为VGT3,其团队标识是一只张着嘴、手里拿着一本书的恐龙。该团队的工作流程与常规的图书仓储或物流业务存在明显差异,其核心任务并非存储或配送,而是将纸质内容转化为数字化文本。多位员工表示,他们每天处理的图书数量庞大,且工作节奏以扫描效率为导向。

亚马逊近年来在人工智能领域投入巨大,其云计算部门AWS已推出多款大语言模型和AI开发工具。训练这些模型需要海量的高质量文本数据,而图书因其内容完整、语言规范,一直是AI训练数据的重要来源之一。此前已有多个科技公司因使用受版权保护的图书进行模型训练而面临法律诉讼,包括OpenAI、Meta等公司均被作者和出版商起诉。

此次被曝光的图书扫描行为引发了关于版权保护和数据获取方式的进一步讨论。在AI训练数据需求持续增长的背景下,如何合法合规地获取高质量文本数据,已成为整个行业面临的共同问题。珍稀图书通常具有较高的文化和学术价值,其物理形态本身也是收藏和研究对象,将其直接销毁进行数字化的做法,在行业内并不多见。

截至发稿时,亚马逊尚未就此事发表公开声明。404 Media的报道称,其已就相关问题向亚马逊求证,但未获得明确回应。该报道同时指出,亚马逊的这一图书数字化行为是否涉及版权授权、是否与AI训练直接相关,仍有待进一步核实。

从行业角度看,这一事件折射出AI产业对训练数据的需求正在向更广泛的文本资源延伸。此前,包括Reddit、推特等平台已开始向AI公司收取数据访问费用,多家新闻机构也与AI公司签署了内容授权协议。图书作为深度知识的载体,其数字化和再利用方式同样需要明确的规则框架。此次亚马逊仓库的图书扫描行为,或将促使更多出版机构和作者关注其作品在AI训练中的使用路径。

业内分析认为,随着AI模型规模的扩大,高质量文本数据的稀缺性将进一步凸显。科技公司通过收购实体图书进行扫描,虽然可以获取结构化程度较高的文本内容,但这一方式的合规性和可持续性存在疑问。未来,AI公司可能需要建立更加透明、合法的数据获取机制,以避免版权纠纷并维护创作者权益。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
Groq完成3.5亿美元融资,从AI芯片转向Nvidia驱动的neocloud业务
上一篇 2小时前
月之暗面怒斥“朋友基金”和“老股额度”:别拿AI明星公司当韭菜田
下一篇 3天前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部