据内部文件显示,微软应用科学总监Brent Hecht对抓取新闻内容训练AI的做法提出严厉批评,认为这构成了人类历史上规模最大的劳动盗窃。Hecht明确表示,此类行为不符合合理使用的范畴,是对合理使用理念的嘲弄。微软的另一份内部文件则指出,这种数据抓取模式将形成恶性循环,同时损害AI模型和整个Web生态。
文件披露的数据印证了这一担忧。微软统计显示,部分新闻出版商网站的点击率下降了83%至93%,其他新闻机构的点击率降幅则在51%至94%之间。Hecht在文件中承认,几乎没有人希望自己创作的内容被以这种方式使用,也没有人因此获得报酬。这一表态与微软CEO纳德拉此前在作证时的立场形成呼应,纳德拉曾表示AI公司不应通过绕过付费墙违反新闻网站的使用条款。
然而,OpenAI的内部信息呈现出不同态度。当一名员工通知总裁Greg Brockman,OpenAI爬虫找到了绕过《纽约时报》付费墙的漏洞时,Brockman回应称“好极了”。OpenAI旗下产品ChatGPT等生成式AI工具被指可能危及新闻出版商的经济基础,而OpenAI和微软的数据均显示这一预测正在成为现实。
此次曝光的内部文件将AI训练数据来源的合规性问题再次推向台前。新闻出版商与AI公司之间围绕内容授权、流量流失和版权保护的矛盾持续加剧,而微软内部对数据抓取行为的反思与OpenAI的激进做法形成鲜明对比,反映出科技巨头在AI数据获取策略上的立场差异。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。