据多家媒体报道,亚马逊正在销毁部分稀有书籍,以利用这些文本训练其大语言模型。这一做法在出版界和学术界引发广泛关注,因为稀有书籍在训练数据中具有不可替代的价值。
亚马逊最初以在线销售图书起家,如今其业务已覆盖云计算、人工智能等多个领域。消息人士指出,亚马逊将部分难以获取的稀有文本用于AI训练,这些书籍由于年代久远或发行量有限,在公开互联网上几乎无法找到。对于大语言模型而言,这类数据能够提供独特的语言模式和知识体系,而现有模型已经消耗了互联网上几乎所有可获取的公开数据。
这一行为引发了关于版权和文化遗产保护的讨论。出版行业人士担忧,将稀有书籍用于AI训练可能涉及版权问题,同时也会造成珍贵文本的物理损毁。目前,亚马逊尚未就此事件发表官方声明。
从行业角度看,此举反映出AI公司在训练数据枯竭背景下的应对策略。随着高质量公开数据的日益稀缺,企业开始寻求从非公开渠道获取训练素材,这其中包括图书馆馆藏、历史档案以及稀有出版物。然而,如何在技术需求与知识产权保护之间取得平衡,正成为AI行业面临的新挑战。
此次事件也凸显了大语言模型训练数据来源的敏感性和复杂性。业内分析认为,随着监管趋严和数据获取难度增加,AI公司需要探索更加合规、透明的数据采集方式,以避免类似争议的持续发酵。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。