国内大模型厂商密集启动预训练返工,数据质量成AI竞赛关键瓶颈

数据在模型厂商的训练预算里占比并不大,业内流传的一个粗略拆解是:每投100块钱在AI训练上,其中40块花在算力上,30块花在人才上,20块花在打广告上,剩下10块钱花在数据上。

过去大半年,国内一批AI模型厂商密集启动预训练返工,核心原因指向数据质量问题。部分厂商此前投入一年时间研发万亿参数模型,落地表现却被规模仅为自身1%的小模型反超,最终排查发现是脏数据拖累了模型效果。另有厂商因数据标注规则模糊、评测集污染、垃圾语料冗余等工程问题导致进展迟缓,还有厂商因数据受限遭遇性能瓶颈,选择推倒重来并重建数据团队。

据行业数据专家透露,早期预训练阶段普遍存在“数据多就可以了”的认知误区,厂商为凑齐数千亿甚至上万亿token的语料库,抓取了大量网页垃圾和来源不明的清洗包,标注与筛选环节也未得到充分重视。底层脏数据的危害超出预期,不仅浪费算力、资金和人力,还会耽误关键时间窗口。有中部基模公司曾将爬取的技术博客整批灌入预训练语料,训练中期才发现其中大量内容为采集站机器生成页面,同一段落重复数万次,模型在评测集上出现异常复读,此时数万卡时已经消耗,该版本只能作废重来。

对数据团队的考核机制同样存在普遍问题。有厂商出现标注规则定义不清但验收线设定过高的情况,团队为交差生产出大批无法使用的数据,叠加打榜数据和冗余数据污染,最终不得不重新组建团队从头清洗数据。业内观点认为,大模型比拼的是数据的信息密度和干净程度,而非绝对体积,仅以数据量作为考核指标会鼓励团队以垃圾数据凑数。

互联网时代积累的场景数据在AI时代并未形成预期壁垒。本地生活、社交、游戏、电商与搜索等领域的数据优势,落到通用能力上影响有限。AnthropicOpenAI等此前在数据上零积累的厂商反而进展更快,国内情况类似,各家基本站到了同一起跑线。拉开差距的因素在于算力储备、数据获取速度、数据质量以及能否建立将数据稳定转化为模型能力的管线。

数据优化并无捷径。业内人士表示,数据工作更偏苦活累活,需要持续投入人力和定力,将原来60分的数据逐步优化到90分。实际操作中需平衡优化成本与训练周期,先挑重要数据分期处理,小步快跑不断迭代。后训练所需的专家数据和Agent长程轨迹数据,获取难度和成本同样不低。

制约数据工作的核心因素是预算与产能。业内粗略拆解显示,每投入100元在AI训练上,约40元用于算力,30元用于人才,20元用于广告,仅10元用于数据。专家数据方面,美国HLE调研一条起价一两万美金,国内基本只给一两千人民币。高质量数据供给不足的情况下,部分厂商通过API中转站截留用户交互轨迹,做Token转发以收集真实任务数据,模型路由创业公司也在关注这一数据资产。

“数据飞轮”被视为大模型真正的护城河,即模型越强,越多用户处理高难度任务,回流的高质量数据越多,模型再进一步变强。但目前真正将这一闭环运转起来的厂商寥寥。除预算受限和外部数据获取难外,大厂内部各部门之间的数据墙破除仍在推进,数据清洗、数据管道搭建、数据工程等岗位人才匮乏,且国内模型厂商还面临内生数据匮乏的问题,长程轨迹数据目前主要出自AI Coding和AI办公两个场景。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
微软时隔 10 年更新 Surface Mouse 鼠标:支持触觉反馈、配可编程按键
上一篇 3小时前
微软发布 Ink Canvas 数字墨迹工作区,将于 10 月 13 日上架 Microsoft Store
下一篇 3小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部