AI数据行业进入智能体数据阶段,多家初创公司估值快速攀升

随着AI从回答问题走向执行任务,数据公司的交付物也在变化:从专家写出的评分标准,到包含任务、工具和验证机制的强化学习环境。

随着AI模型能力持续提升,训练需求日趋复杂,一批为模型公司提供训练数据的新兴企业正在快速增长。据公开信息,数据服务公司AfterQuery在今年4月宣布A轮融资时估值为3亿美元,到9月,新一轮融资已将其估值推至32亿美元。另一家提供训练数据与智能体环境的公司Bespoke Labs,也在今年7月宣布种子轮与A轮融资合计达到4000万美元。估值快速攀升的同时,AI数据行业对外界而言仍高度不透明。

过去,数据标注行业的主要工作是给图片打标签、为模型回答打分,属于相对基础的人工标注范畴。但随着AI从回答问题转向执行任务,数据公司的交付物正在发生结构性变化。在Scale AI负责后训练与评测研究的何允中看来,当前数据公司的基因差异明显:有做招聘出身的Mercor、Handshake,有从众包网络起家的传统数商Scale AI,也有专注合成数据的新兴团队,还有部分垂直领域公司因自身积累的数据资产而转行进入数据生意。具身智能领域的部分模型公司尚未实现盈利,但已投入大量精力进行数据投资,并顺势开展数据业务。

从行业格局看,Mercor、Surge AI、Scale AI等大型玩家试图覆盖尽可能多的数据品类。与此同时,BigCode、Snorkel AI等新秀则偏向研究与工程方向,主要生产代码或工具调用类环境,抓住了今年的市场风口。此外,一些小型公司专注解决垂直领域问题,甚至扮演数据经纪商角色,例如拥有大量版权数据的好莱坞从业者,能够将不同领域的资源进行对接与销售。何允中认为,大型数商在进入新领域时具备资源优势,而垂直领域专家组成的小团队同样存在机会,整体市场空间仍在扩大。

商业模式方面,Mercor以招聘业务起家,通过自动AI面试产品在较短时间内匹配足够数量的专家,构建专家网络。Surge AI则更倾向于将相关能力内部化。何允中指出,数据公司普遍面临取舍:完全依靠全职培养的人员能力强但灵活度不足、产能受限;更多依赖众包网络则灵活性高,但个体质量难以保障,质检成为关键环节。Scale AI等公司的优势在于积累了数据与人员两方面的质检经验。

行业需求的变化节点大致出现在2024年。此前,数据讨论多集中于人工标注和预训练所需的大规模基础数据。随着Deep Search兴起,行业逐步转向智能体数据,对评分细则和强化学习环境的需求显著上升。何允中表示,预训练依然重要,但研究人员的兴趣已明显转向强化学习。o系列模型出现后,推理能力在强化学习路径上得到验证,可验证信号成为核心问题。代码和数学领域因具备客观标准答案,最早被用于推理模型的强化学习训练。

当强化学习向医疗、金融及更基础的指令遵循领域扩展时,新的挑战随之出现。这些领域存在客观标准答案,但答案结构化程度较低,难以通过简单的模式匹配判断对错。评分细则因此成为关键机制:由专家将知识转化为打分规则,较弱模型依据规则完成评判,这一过程被称为“弱到强监督”。该模式成立的前提是专家能够将脑海中的知识完整写出,使弱模型具备改卷能力。评分细则数据在此后较长时间内保持重要地位,但各专家领域中较易获取的评分细则已逐渐被收集殆尽。

Mercor、Surge AI等公司的崛起与专家评分细则的需求直接相关。而行业继续向前推进,则需要模型真正“动手”执行任务。以代码模型和Agents’ Last Exam项目为例,模型需要在智能体环境中解决问题,数据公司不仅提供评分细则,还需配置工具,并设计更复杂的验证方式,例如检查环境变量是否执行、数据库是否被写入或删除,甚至需要智能体来检查包含图表的生成文档。交付物因此变得更加多样,行业门槛也随之提高。

整体来看,AI数据行业正从单一的人工标注向包含任务、工具与验证机制的强化学习环境演进。大型数商凭借资源与质检经验覆盖广泛品类,垂直团队则依靠领域专长寻找切入点。在模型能力竞争日趋激烈的背景下,训练数据的质量与结构设计,正在成为影响模型实际表现的关键变量之一。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

赞 (0)
英伟达拟再投10亿美元加码Figure,黄仁勋以投资布局对冲AI需求焦虑
上一篇 3小时前
碳阻迹完成亿元B轮融资,红杉中国领投
下一篇 2022年8月3日 下午9:42

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部