北美AI一线调研:模型按月进化,但组织与物理世界仍在按年适应

下一阶段的机会,可能不只在能力曲线最前端,更在能力、交付与现实之间尚未填平的落差里。

9月初,一支调研团队在15天内横跨硅谷、洛杉矶、西雅图、波士顿和纽约,与101位北美AI一线从业者进行了高密度交流。调研对象中,41位来自Google、Meta、Nvidia和OpenAI等新老大厂,其中17位来自各前沿实验室(Frontier Lab),42位拥有博士学位,82位年龄在35岁以下。最年轻的一位21岁,2023年高中毕业后进入宾夕法尼亚大学,大三辍学创业,目前是一家AI应用公司的联合创始人。

这组数据勾勒出当前AI产业核心圈层的基本面貌:一批站在技术曲线最陡峭处的年轻人,正在以截然不同的节奏经历同一场技术革命。有人在提升模型能力上限,有人在压低每次推理的成本,有人在探索AI参与科研的新范式,也有人仍在等待一纸并网许可,等待期长达5年。模型按月进化,电网按年扩容,组织和人则按各自节奏适应。

调研期间,OpenAI发布了GPT-6 Astra。但比发布会更值得关注的是前沿实验室研究员对工作状态的描述。一位研究员表示,半年多前模型还像研究实习生,现在感觉已经超过了自己。另一位研究员称,日常工作主要是监督和鼓励自己的一万个智能体,有时接杯咖啡,等智能体出结果。还有不到30岁的一线研究员半开玩笑地说,一两年后可能也可以退休了。

一位实验室研究员给出了一组对比数据:过去一个预训练团队需要一两百人,现在约二十人即可推进,一年后也许只需要五个人。从Human in the Loop到AI in the Loop,变化已不只是多一个助手。研究员提出方向,智能体写代码、跑实验、比较结果,再把新线索交回来。人仍在其中,但工作重心正从亲手完成每一步,转向组织一整套研究过程。

然而,更强的模型不会自动变成更好的交付。Mert Demirer等人对超过50万名开发者的研究量化了这种落差:自主编码智能体带来的代码提交活动增幅为240%,项目数量增幅为80%,实际发布增幅仅为30%。从提交到发布,提升一层层变薄。

这种落差在大型组织的管理实践中已有反馈。9月初,几位来自某大厂技术相关部门的从业者提到,公司已不再用AI采用率看板或token用量来评价员工的工作影响,而是回到产出质量、工作速度和所解决问题的复杂度。此前将用AI的量纳入考核,例如要求代码中一定比例由AI编写,结果出现了大量bug。AI写的代码量又大,review起来非常困难,检查和修复的成本快速上升。硅谷为此发明了一个词:Tokenmaxxing,即为好看的指标刻意消耗token。

类似变化不只出现在一家公司。年初行业看到的是token价量齐升,后来发现用了大量token,产出却一般。行业已从用更多走到怎么用更好、ROI更高的阶段。Token是投入,代码量是中间产出,客户愿意付费的结果才接近价值,三者不能混为一谈。

关于Scaling能否持续,两年前同一位硅谷核心模型研究员曾被问及数据是否快用完。此次调研中,他依旧给出肯定答案,认为一两年前训练数据的瓶颈正在被强化学习、任务环境和新的扩展路径打开。一线研究者对模型能力持续发展相当乐观,这种乐观不只来自在现有架构里继续堆数据和算力,更来自RL、environment乃至新架构带来的新扩展路径。

但调研也显示,更强的模型不会自动让物理世界按同样速度迭代。下一阶段的机会,可能不只在能力曲线最前端,更在能力、交付与现实之间尚未填平的落差里。对于企业服务领域的从业者而言,这意味着AI产品的竞争焦点正在从模型能力本身,转向如何将能力转化为客户可付费的交付结果。组织如何重新定义考核方式、如何管理AI生成内容的质量与成本、如何在token投入与业务产出之间建立清晰的ROI框架,将成为接下来一段时间内更值得关注的议题。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

赞 (0)
腾讯混元Hy4 Preview登顶Arena对齐指数中国第一,姚顺雨出任AI Data部负责人
上一篇 2小时前
反向开票与碳关税重塑废品回收业,再生金属利润半年翻倍
下一篇 2小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部