8月21日,全球最大协作式生活指南百科网站WikiHow向美国曼哈顿联邦法院提起诉讼,指控OpenAI未经许可抓取超过11,000篇教程文章,用于训练ChatGPT及GPT系列大型语言模型。诉状指出,OpenAI的行为至少侵犯了WikiHow拥有的1,200项已注册版权。这是继多家新闻机构和内容平台之后,又一起针对AI公司大规模使用网络内容训练模型的版权诉讼。
WikiHow是全球最大的“怎么做”(How-to)类内容平台,其内容涵盖从日常家务到专业技能操作的各类教程,由全球贡献者协作编写并经过编辑审核。诉讼文件显示,OpenAI抓取的文章覆盖多个主题,系统性地复制了WikiHow的文本内容。在模型训练完成后,ChatGPT能够根据用户提示复现WikiHow的文本,并生成相同主题的教程内容。
WikiHow在诉状中强调,OpenAI的模型在吸收了平台文章后,已经能够以远低于原创内容生产所需的时间、精力和成本,生成与WikiHow文章形成直接竞争的教程内容。这种替代效应正在减少WikiHow的流量和收入,长期来看,将削弱平台继续创作和更新内容的经济动力。诉讼认为,这种行为不仅损害了WikiHow的商业利益,也破坏了原创内容生产者的创作生态。
针对诉讼,OpenAI发言人于8月24日回应称,公司模型使用公开数据训练,并基于合理使用原则进行内容利用。发言人未就具体指控细节作出进一步说明。截至发稿,WikiHow的发言人和代理律师尚未对媒体置评请求作出回应。
此次诉讼是OpenAI近年来面临的系列版权纠纷中的最新一例。此前,包括《纽约时报》、多家新闻集团以及部分作家群体均已对OpenAI提起类似诉讼,指控其未经授权使用受版权保护的文本训练模型。与新闻机构不同,WikiHow的案例聚焦于“教程类”内容的版权边界,这类内容通常具有更强的实用性和可替代性,其商业价值更直接地体现在搜索流量和广告收入上。
法律专家指出,WikiHow案的核心争议点在于“合理使用”原则在AI训练场景下的适用范围。美国版权法中的合理使用条款考量使用目的、作品性质、使用比例以及对原作品市场的影响等因素。OpenAI主张其训练行为属于转化性使用,而WikiHow则强调模型生成的教程内容与原作形成直接市场竞争,对原创内容的市场价值构成实质性损害。
从行业角度看,此类诉讼的判决结果将对AI大模型的训练数据获取方式产生深远影响。目前,主流AI公司普遍依赖大规模网络爬取来构建训练数据集,若法院认定此类行为不构成合理使用,AI公司或将面临高昂的授权成本,并可能被迫调整技术路线,转向使用经过授权的数据源或开发合成数据生成方案。这将直接影响AI模型的训练效率、成本结构以及最终的产品定价。
截至目前,法院尚未就WikiHow的禁令请求作出裁定。该案预计将进入漫长的证据交换和庭审阶段。业界普遍关注此案能否为AI训练数据的版权边界提供更清晰的司法指引,尤其是在教程类、指南类等实用性内容的保护方面。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。