OpenAI自研芯片9个月流片背后:AI提效与博通工程能力双轮驱动

对于第一代芯片而言,其更重要的意义在于从头跑通了一套AI参与芯片设计的工作流。

OpenAI自研芯片项目正以超出行业惯常节奏的方式推进。按照OpenAI今年8月公布的进展,其第一代自研芯片Jalapeño(下称“小辣椒”)计划于年底前开始部署,第二代已进入深入开发阶段,第三代也开始成形。更引发产业链关注的是,OpenAI官方披露第一代“小辣椒”从初始设计到流片仅耗时9个月。前端设计验证工程师穆洋估算,这一速度比没有AI辅助的设计快了约半年。

不过,9个月仅覆盖了芯片设计全流程的部分环节。若将前期的需求定义、架构规划,以及后续的制造、调试与部署全链路计算在内,一颗定制ASIC的真正落地依然需要以年为单位。而在这一漫长的硬件周期内,大模型往往已经历了数轮架构与算法的迭代。芯片与模型以完全不同的节奏演进,使得下一代芯片的设计极限、以及模型架构剧变后由软件栈消化的比例,成为行业核心议题。

OpenAI自研芯片的野心至少可以追溯至2023年。彼时首席执行官奥尔特曼甚至一度想推动30多座晶圆厂的建设,但高昂的成本和漫长的周期开始劝退这家连Fabless模式都不具备的模型企业。2024年,OpenAI已将重心转向自己更具优势的部分——围绕自家模型和推理服务定义芯片需求。据OpenAI披露,AI已参与“小辣椒”的实现方案探索、“设计—测量—验证”循环和部分算术电路优化,并继续参与芯片回片后的调试和编程。

拆解OpenAI 9个月流片的节奏可以发现,除AI对流程的提效外,博通成熟的工程能力同样是不可缺少的拼图。多位产业链从业者指出,博通的硅实现能力、网络互连能力、接口IP以及多年积累的工程体系,为OpenAI省去了大量从头搭建底层能力的时间。这些私有的知识体系并不会随着通用大模型能力变强而自动转化为OpenAI自身的能力。某芯片企业产品总监陆吉年强调,AI在其中的作用仍不容小觑。对于第一代芯片而言,其更重要的意义在于从头跑通了一套AI参与芯片设计的工作流。一旦这套流程能够复用,下一代就不用再重新摸索同样的路径,人工介入还有继续减少的空间。基于“小辣椒”结构的复杂程度,陆吉年认为9个月已经“很不错”,但OpenAI完全有能力实现6个月的设计周期。

目前OpenAI披露得最明确的,是AI已经进入RTL(寄存器传输级)这一芯片设计的核心环节。芯片架构确定以后,AI开始参与把想法写成描述数字电路代码的过程。穆洋曾靠AI完成首战:在给出性能目标、设计约束和测试要求后,她成功利用AI生成和修改某一RISC-V CPU开发项目里的RTL。AI对芯片开发的另一加持在于验证设计环节。据穆洋表述,同一项目里一项过去需要两名有经验工程师花费约4个月完成的UT(单元测试)验证任务,如今在AI加持下,她一人就能在3周左右跑完从测试点拆解到最终结果确认的整个闭环,节省超100天,效率提升80%。

这种变化也已进入成熟芯片公司的真实开发流程。英伟达今年公开披露,已将Cadence的AI Agent用于RTL验证,使得一项过去需要5周才能完成的工作如今只需不到一天。Cadence方面人员透露,包括老牌FPGA企业Altera、高通、Tenstorrent在内的多家芯片公司也已开始部署类似Agent,其中Altera称部分验证工作量已压缩至约原来的十分之一。另一方面,模型能力本身的变化也在继续拓宽AI可处理的信息形式。陆吉年认为,最新一代模型对图形、空间关系等信息的理解能力正进一步增强,这意味着AI能够介入的芯片设计范围,逐渐从“怎么把电路写出来”延伸至“电路怎么在芯片上摆放和连接”。

即使局部环节提效,芯片的完整开发周期与模型迭代速度之间仍存在难以跨越的时间鸿沟。以初代“小辣椒”为例,仅从2024年10月底项目被公开报道,到OpenAI计划于2026年底前初步部署芯片,中间就横跨约26个月。大模型从业者Jim认为,只有当AI Agent将整条开发链条进一步压缩至18个月左右,自研ASIC才具备真正的商业吸引力。但即便如此,与模型动辄月级的更新频率相比,芯片设计仍需以年为单位提前布局。

模型更新并不意味着硬件必须推倒重来。Jim解释,如果只是同个模型换了一套权重、部分计算方式发生调整,或者矩阵的大小和排列发生变化,通常还能通过Kernel、编译器和调度方式进行适配。真正让芯片设计者头疼的,是原本按某种比例匹配好的算力、内存和通信能力可能不再适合下一代模型。MoE(混合专家模型)就是典型例子:模型从稠密结构转向MoE后,芯片要做的基础计算并没有完全改变,但数据需要在不同专家、不同芯片之间流动,通信和存储压力可能一下子变大。此外,Attention算子结构怎么变、Token未来更多是串行还是并行生成,同样可能重新改变存储、带宽和算力之间的比例。

针对“哪些能力值得固化进硬件,哪些变化可以由软件调控”的问题,Jim认为企业最重要的是算三笔账:为了保留灵活性,愿意额外付出多少面积、功耗和开发成本;这项能力未来能覆盖多少种模型和场景;专用化带来的性能和成本收益,是否足以覆盖押错方向的风险。但最难提前预测的,也正是这些具体的比例。“小辣椒”本身已经在处理这样的不确定性。OpenAI透露,项目早期曾考虑过更加偏向Decode的设计,但最终还是选择让同一块芯片同时支持Prefill和Decode两个阶段,将调整空间留给软件。在Jim看来,这恰恰也是AI正在发挥作用的另一面:AI不只是让专用芯片更快被设计出来,也在让留给软件的那部分适配变得更快、更便宜。

无论软硬件如何被AI加速,最终的决策仍离不开人类的判断。AI设计芯片企业Novasilicon创始人李林阳指出,目前AI表现优异的仍是RTL代码实现等边界清晰的任务,越往顶层的架构与规格定义走,Agent越难介入,因为连人类架构师自身都难以在这个庞大的探索空间中界定清晰的边界。结果验收同样如此。穆洋认为,当前仍需要有10至15年经验的工程师来完成判断,只有等AI自身的验证和判断能力进一步成熟,才可能真正走到“小白也能做芯片”的阶段。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
亚马逊在印度推出Alexa+并支持印地语,早期体验阶段向所有用户开放
上一篇 21小时前
Listrak推出Listrak Studio,可将Figma设计稿在数分钟内转化为可发送邮件
下一篇 21小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部