微软内部文件称AI数据抓取为“人类历史上最大规模劳动力窃取

最新解封的法庭文件显示,微软内部曾将OpenAI的数据抓取行为称为“窃取”,与此同时两家公司都在抓取《纽约时报》的付费墙内容并据此构建数据集。

最新解封的法庭文件显示,微软内部曾将OpenAI的数据抓取行为定性为“人类历史上最大规模的劳动力窃取”,而与此同时,两家公司都在抓取《纽约时报》的付费墙内容、据此构建数据集,并在内部警告此举将重创出版商。

这批未删节文件来自《纽约时报》对微软和OpenAI提起的版权诉讼。文件披露了微软高管层对AI训练数据来源问题的内部认知,与其公开表态之间存在明显落差。微软方面在内部沟通中使用“窃取”一词描述OpenAI的数据实践,表明该公司对相关行为的法律与伦理风险有清晰判断。

文件同时显示,微软与OpenAI在抓取《纽约时报》付费内容方面存在协同行为。两家公司将抓取所得内容用于构建训练数据集,并在内部评估中承认,这种大规模内容获取方式将对出版商的商业模式造成实质性冲击。这一内部预警与两家公司此前关于AI训练数据“合理使用”的公开立场形成对照。

该诉讼是美国媒体行业针对生成式AI企业提起的一系列版权案件中最受关注的之一。《纽约时报》指控微软和OpenAI未经授权使用其数百万篇报道训练大语言模型,侵犯版权并削弱其订阅业务。此次解封的文件为外界提供了迄今最直接的证据,显示AI公司在数据获取环节对潜在法律风险有充分认知。

从行业影响看,这批文件可能对正在审理中的多起AI版权诉讼产生连锁效应。若法院认定AI企业在明知内容受版权保护的情况下仍系统性抓取,合理使用抗辩的成立难度将显著上升。对于依赖公开网络数据训练模型的AI厂商而言,数据来源的合规审查正从边缘问题演变为核心风险点。

微软与OpenAI目前均未就解封文件的具体内容作出进一步回应。案件后续审理将继续聚焦于训练数据的获取方式、使用范围以及两家公司在其中的责任划分。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
AI安全争议升温,CFO面临更大风险管理压力
上一篇 12小时前
联合国与谷歌合作,将全球数据改造为AI智能体可读格式
下一篇 12小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部