牛津大学博德利图书馆藏书被用于OpenAI模型训练,合作细节引发教职员工担忧

一份内部文件显示,由 OpenAI 完成数字化的博德利藏书已被用来“构建 OpenAI 的训练集”。

据英国《卫报》报道,牛津大学已允许ChatGPT开发商OpenAI利用其博德利图书馆(Bodleian Library)的历史典籍训练人工智能模型。博德利图书馆是牛津大学主要的研究图书馆,也是英国规模仅次于大英图书馆的第二大图书馆。一份内部文件显示,由OpenAI完成数字化的博德利藏书已被用于“构建OpenAI的训练集”。

牛津大学于2025年3月宣布与OpenAI达成合作,使用后者软件对该校图书馆藏书进行数字化处理。校方当时表示,此举将让学生和研究人员更便捷地查阅文献资料,但合作公告未提及这些资料会被用于训练OpenAI的模型。OpenAI发言人表示,公司很荣幸能够促成“当今的AI模型为后世守护人类的历史文化瑰宝”,并补充称全球已有超过十亿人在日常生活中使用这项技术,因此让模型充分反映不同文化、历史和视角至关重要。

根据《信息自由法》调取的牛津大学会议纪要显示,包括博德利管理委员会成员在内的教职员工对合作表达了顾虑。他们担忧与OpenAI合作可能引发声誉风险,同时指出该合作涉及高能耗技术,可能对大学自身的环保承诺产生负面影响。

在名为“NextGenAI”的项目框架下,OpenAI已与波士顿公共图书馆、加州理工学院、麻省理工学院及密歇根大学等多家美国研究型图书馆签署了类似协议。牛津大学是该项目中唯一的英国成员。截至2025年6月,博德利图书馆已向OpenAI提供了12.5万份历史学位论文的扫描影印页,涵盖19至20世纪欧美高校的博士论文。其他已扫描文献还包括一份罕见的16世纪“宽边民谣”珍藏集,共计1万首,记录了曾流传于都铎王朝街头巷尾的歌词与乐谱。教职人员还商讨了后续数字化计划,涉及18世纪爱尔兰国家档案、爱尔兰小说家玛利亚·埃奇沃思的私人信函,以及多萝西·霍奇金关于青霉素研究的实验笔记。

校方否认了向公众和学生隐瞒机器学习相关用途的指责。牛津大学发言人表示,数字化确实是学校的核心诉求,但教职员工始终明确承认该项目同时会为模型提供训练数据。该发言人强调,通过与OpenAI合作完成数字化的文献资料规模有限,均已超出版权保护期,且OpenAI对这些资料的使用权是非排他性的。博德利图书馆保留了自主发布这些数字化资源的权利,并将在未来几个月内逐步在网络上公开提供这批资料。

此次事件折射出学术机构与AI公司在数据合作中面临的透明度与信任挑战。随着大模型训练对高质量语料的需求持续增长,图书馆、档案馆等文化机构正成为科技公司争夺的数据来源,而如何在数字化合作中平衡公共利益、版权合规与商业用途,将成为行业亟待厘清的议题。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

赞 (0)
OpenCode 将 DeepSeek V4.1 Flash 的 60 美元额度调整为永久有效
上一篇 3小时前
OpenAI引入了“超快” ,这是一种新模式,使GPT-5.6 SOL以14倍的速度工作
下一篇 2026年8月14日 上午3:22

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部