纽约时报诉OpenAI案解封文件曝光:微软内部称用全网内容训练模型是”人类历史上最大劳动盗窃

微软的内部测算显示,Copilot上线后,《纽约时报》域名的点击率相比传统Bing搜索最多下降93%。

2026年9月17日,纽约南区联邦法院解封了一批来自《纽约时报》诉OpenAI和微软版权案的内部文件。这批材料首次披露了被告公司内部对训练数据来源的认知与测算,其中微软应用科学总监布伦特·赫克特在一份内部备忘录中将用全网内容训练大模型称为”一场规模前所未有的惊人盗窃”,并称这很可能是”人类历史上最大的一次劳动盗窃”。

该案已持续近三年。此前庭审走向总体支持”用版权内容训练模型属于合理使用”,而此次解封材料的特殊之处在于,其内容为被告方自身内部记录,而非法律论证。微软内部测算显示,Copilot上线后,《纽约时报》域名的点击率相比传统Bing搜索最多下降93%。赫克特在内部演示文稿中将这一下滑称为”死亡循环”,认为它会同时损害模型表现和整个互联网。他还指出,一个终端产品威胁到自身关键供应商的经济根基,这种情况极不寻常,而这是模型业务与其”内容供应链”共同造成的局面。

ChatGPT负责人尼克·特利在内部沟通中表示,ChatGPT这类产品对出版机构构成”生存威胁”,且”在很大程度上是替代性的”,随着模型能力增强,替代性会愈发显著。OpenAI总裁布罗克曼称这些模型”非常擅长新闻”。微软CEO纳德拉今年作证时亦承认,与聊天机器人对话”已经替代了直接去网站获取信息”。而法律要求不能”替代或损害原作品的市场”。

文件同时披露了训练数据规模。仅OpenAI训练数据集中,就包含《纽约时报》《每日新闻》和调查报道中心的作品91692份拷贝。在一个从Common Crawl派生的数据集中,仅nytimes.com一个域名就抓取了两百多万份文档。其他媒体方面,从《纽约时报》抓取390万份,从《芝加哥论坛报》及其相关报刊抓取730万份。此外,一个名为Project Mango的项目数据集包含至少160903部新闻出版方的独立作品。OpenAI将整个GPT-3训练数据集交给微软,微软则通过Project Taxi和Project Mango将数据回输给OpenAI。

文件还记录了具体操作方式。OpenAI研究员尼克·赖德曾告诉布罗克曼,自己有一个”绕过纽约时报付费墙的黑客方法”,布罗克曼回复”不错”。两人搭建的数据集WebText、WebText2中,相当大一部分是从网上直接抓取的新闻报道,并从Common Crawl拉取了数百万篇文章。在数据进入模型前,研究人员会刻意删除版权声明,原因是”不想让模型向用户输出版权声明”。

原告代理律师史蒂文·利伯曼表示,证据表明OpenAI和微软知道自己的行为是错误的。微软对这批文件回应称,相关言论仅反映一名员工的个人观点,不是法律分析,也不代表公司立场。赫克特并非决策者,公司雇他是为了”呈现不同的、非对称的视角”。

这并非OpenAI首次因训练数据面临集体诉讼。2023年9月,美国作家协会连同约翰·格里森姆、乔治·R·R·马丁、朱迪·皮考特等17位作家在纽约南区对OpenAI提起集体诉讼,此后多起作家诉讼陆续并入,原告规模持续扩大。《纽约时报》诉状证物J题为《GPT-4记忆〈纽约时报〉内容的一百个例子》,长达127页,显示模型在给定文章开头后可近乎逐字补完剩余内容,包括署名和引语。2026年arXiv发布的论文《对齐打地鼠》进一步显示,将模型微调为”按情节写全文”后,GPT-4o、Gemini 2.5 Pro能复现85%至90%的版权书籍原文,单段逐字复现超过460个词。

类似的数据抓取争议并不限于OpenAI和微软。2026年9月4日,一起集体诉讼递交至伊利诺伊北区联邦法院,原告指控Meta未经同意抓取Facebook和Instagram用户的照片及生物特征数据,用于训练人脸识别系统NameTag背后的模型、比对用人脸指纹,以及生成式图像模型Emu和Muse Image。Meta回应称诉讼没有依据,NameTag未向消费者发布,也未最终决定用途,并强调公司”不是在建立一个通用的人脸数据库”。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

赞 (0)
百度地图发布V22版本,升级车道级导航4.0与全域护航系?
上一篇 2小时前
前高通苹果工程师团队推出WarpCore核心优先开发模式,拟先建微架构后定指令集
下一篇 1小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部