9月15日,在济南召开的2026年国家网络安全宣传周人工智能安全治理分论坛上,中文互联网基础语料4.0正式向社会发布,数据量达120GB,并同步在“中文互联网语料资源平台”上线。用户登录中国网络空间安全协会官网,点击“中文互联网语料资源平台”链接,通过注册、认证等程序,即可下载或联系获取相关数据。
该语料库由中央网信办指导,中国网络空间安全协会联合国家互联网应急中心,会同百度、中科闻歌、开普云、拓尔思、科大讯飞、知乎等单位共同建设。项目依托网安协会人工智能安全治理专委会建立的语料共建共享机制,在前期发布的1.0、2.0和3.0版本基础上,汇聚了一批新的高质量可信数据,并经过严格细致的数据加工处理措施,最终形成4.0版本。
中文互联网基础语料项目的推进节奏较为清晰。从此前版本到此次4.0发布,语料规模和数据质量均有所提升,参与共建的单位覆盖搜索引擎、人工智能技术企业、数据服务商和内容社区等多类主体。这种多方协作模式旨在解决中文高质量语料分散、标准不一、获取门槛较高等问题,为国内大模型训练提供更系统的数据来源。
从行业背景看,大模型能力高度依赖训练数据的规模与质量。中文语料长期面临高质量数据稀缺、版权归属复杂、清洗加工成本高等挑战。尤其在通用大模型竞争进入深水区后,各家厂商对可信、合规、结构化中文数据的需求持续上升。中文互联网基础语料4.0的发布,在一定程度上补充了市场化的数据供给,也为中小型AI团队降低了数据获取门槛。
网安协会负责人表示,中文互联网基础语料4.0是社会各界协同共建高质量中文语料的重要阶段性成果,进一步丰富了国内高质量中文语料供给体系。下一步,协会将继续联合国家互联网应急中心等单位,联动各行业领域深化中文互联网基础语料建设,持续为人工智能产业高质量发展筑牢数据底座。
值得关注的是,语料资源平台采取了注册认证后获取的机制,这一设计兼顾了数据开放与安全合规的双重目标。在当前人工智能安全治理框架下,语料来源可追溯、使用可管理,正成为行业共识。对于企业用户和开发者而言,此类官方背书的语料资源在合规性上具备一定优势,有望在模型预训练、微调以及垂直领域应用中发挥作用。
随着中文大模型数量持续增长,高质量语料的公共供给能力将直接影响国内AI产业的整体水平。中文互联网基础语料4.0的发布,标志着语料共建共享机制进入常态化运作阶段,后续版本的数据规模、覆盖领域和更新频率,值得持续关注。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。