在众智 FlagOS 开放计算全球大赛赛季二赛道一的一道算子优化题中,免费 AI Coding Agent 组合 AgnesCode + Agnes 3.0 Flash 与付费组合 Codex + GPT-5.6 Sol 进行了直接对比。测试任务为 DeepSeek-V3 解码阶段使用的融合 QKV-A 下投影算子(Task66: dsv3_fused_a_gemm),要求参赛者编写优化代码并在 8 款芯片上通过赛事官方自动化评测。最终,AgnesCode 通过 6 款芯片,Codex 通过 7 款;在双方共同通过的 5 款芯片上,AgnesCode 有 4 项加速比高于 Codex。
算子是大模型运行时反复调用的底层计算程序,每生成一个 Token,都需要在 GPU 或其他 AI 芯片上执行大量矩阵计算、注意力计算和数据变换。单个算子的性能提升看似有限,但高频调用下,几个百分点的加速比即可转化为推理速度、硬件利用率和服务成本的差异。此次测试选择算子优化作为任务,旨在考察 Coding Agent 能否进入 AI Infra 层面的真实工程工作,而非仅完成网页生成或应用开发等常规任务。
测试题目来自众智 FlagOS 开放计算全球大赛赛季二赛道一,该赛道围绕 SGLang 推理框架开放了 200 余道算子任务,每周发布一批题目,参赛者仅能在当周看到赛题内容。这一机制降低了测试任务数据被模型提前学习的可能性。两组候选者使用完全相同的环境为算子撰写优化代码,并提交至赛事官方自动化评测系统。AgnesCode 使用官方提供的免费模型 Agnes 3.0 Flash 作为后台,Codex 则使用 GPT-5.6 Sol。
从任务执行过程看,Codex + GPT-5.6 Sol 组合用时 8 分 57 秒完成任务,整体推进更快、更流畅。AgnesCode + Agnes 3.0 Flash 组合在第二阶段生成代码时,先花费 7 分 10 秒未给出答案,经测试人员催促后,再经过 13 分 26 秒给出针对不同后端调整优化的代码,最终总耗时 20 分 36 秒。该组合完成了从编写实现、跨芯片适配到代码自检、打包和交付的完整工作流程。
官方自动化评测结果显示,AgnesCode 在芯片适配数量上落后 Codex 一款,但在双方共同通过的 5 款芯片中,有 4 项加速比更高。其中,在国际通用芯片 B 上,AgnesCode 达到 4.81 倍,高于 Codex 的 3.71 倍,加速比高出约 29.6%;在天数智芯上,AgnesCode 为 2.16 倍,Codex 为 1.72 倍;昆仑芯上仅 AgnesCode 通过测试。
这一结果的意义不在于免费模型对付费模型的全面替代,而在于当任务边界、工具链和评测闭环足够清晰时,免费 Agent 已能进入底层工程任务,并交出可验收、有性能收益的产物。对于 AI Infra 领域而言,Coding Agent 正在从应用层开发向算子优化等底层环节延伸,模型成本与任务交付能力之间的区分度也将随之显现。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。