亚马逊AI训练设施员工披露图书扫描工作细节

亚马逊最初告诉他们扫描的书页是用于 kindle 电子书库,这无疑是借口,因为肯定存在版权方面的问题,后来他们才知道是为训练 AI 建立语料库。

据 404 Media 报道,亚马逊位于内华达州拉斯维加斯的一处仓库内,一个代号为 VGT3 的团队正从事图书扫描工作,这些扫描数据被用于训练人工智能模型。该团队的一名员工匿名接受了采访,详细披露了内部工作流程。

这名员工介绍,仓库接收了大量图书,包括新书和二手书,甚至出现过代表英女王提交给议会的文件。图书语种涵盖德语、俄语和日语等多种语言。团队首先扫描图书条形码以识别并移除重复书籍,重复的图书会被退还给经销商。随后,工人使用人工操作的机器切开书脊,再通过数十台扫描仪逐页扫描,扫描完成后的书页会被处理销毁。

该员工透露,亚马逊最初告知他们扫描书页是为了扩充 Kindle 电子书库,但这一说法存在明显疑点,因为涉及版权问题。后来员工才得知,这些扫描数据实际是用于构建 AI 训练语料库。这一过程揭示了大模型训练数据来源的隐秘链条,也引发了对版权合规性的进一步关注。

随着生成式 AI 对高质量文本数据的需求激增,科技公司获取训练语料的方式日趋多样和复杂。此次披露的图书扫描操作,反映了 AI 基础设施中数据采集环节的真实样貌,同时也将版权问题重新置于行业讨论的中心。未来,如何在数据获取与知识产权保护之间取得平衡,将成为 AI 企业无法回避的课题。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
恒玄科技BES2800芯片进入雷鸟iO智能眼镜,6nm工艺集成蓝牙与Wi-Fi 6
上一篇 4小时前
澳大利亚警方逮捕两名涉嫌针对Mercor、OpenAI等科技公司的网络攻击嫌疑人
下一篇 4小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部