智谱AI近日正式确认,此前在OpenCode和OpenRouter平台上以Ox-Alpha名称出现并迅速登顶的模型,即其最新发布的GLM-5.3-Flash。该模型是GLM-5系列的首个原生多模态模型,上线首日即冲至OpenRouter榜首,并刷新该平台单日tokens用量历史纪录,相较此前最大tokens量提升4倍。
GLM-5.3-Flash在Artificial Analysis Intelligence Index的评测中取得57分,超过上一代旗舰模型GLM-5.2,也高于DeepSeek旗舰模型V4 Pro正式版的53分。根据公开榜单数据,该分数远高于同类模型的中间值18分。在能力对标主流闭源模型的同时,其定价策略引发行业关注。官方数据显示,GLM-5.3-Flash每百万Token输入价格为0.8元、输出价格2.8元、缓存命中价格0.23元。横向对比调价后的DeepSeek V4 Flash,其谷时价格分别为输入1.5元、输出4.5元,综合输入和输出成本,GLM-5.3-Flash在绝大多数常规调用场景下更具价格优势。而对比Claude Opus 4.8,按当时汇率折算,Opus 4.8每百万Token输入约35元、输出约175元,GLM-5.3-Flash的价格仅为对方的四十分之一左右。
智谱在发布公告中表示:“同样智力,1/40价格,前沿智能,第一次不需要省着用。”此前8月,DeepSeek V4 Flash已完成一轮提价,涨价反映出市场强劲需求,也意味着“便宜”在商业上难以持续。智谱在GLM-5.3-Flash上选择了相反路径:用更低的成本结构支撑更低价格,同时不牺牲模型能力。这一定价策略背后是工程能力的验证,而非单纯的市场营销动作。
多模态能力是GLM-5.3-Flash的另一核心亮点。此前,智谱首席科学家唐杰在社交平台发起全球意见征集,为GLM-5.3收集功能建议,浏览量超过40万,评论区被“视觉”一词刷屏。作为GLM-5系列的首个原生多模态模型,GLM-5.3-Flash将视觉编码能力原生集成进模型中,使其能够自主判断何时需要“观察”,并利用视觉反馈指导下一步行动,拓展了编程所能触及的边界。
该多模态能力最直接的落点是Coding领域。传统编程模型的工作流程是用户提供需求、模型输出代码、用户运行查看效果、发现问题后再反馈给模型,这是一个由人充当裁判的闭环流程。GLM-5.3-Flash将裁判角色也交给模型自身,视觉能力被原生融入Coding循环,使模型能够主动观察界面、渲染结果与交互反馈,并据此持续测试和改进。模型写完前端代码后可以自行查看渲染页面,完成游戏功能后可以自行测试是否存在bug,搭建3D场景后可以自行检查各视角协调性。
智谱针对视觉编码开发了专门的数据合成流水线,重点训练模型的自我视觉判断与测试时改进能力。最终生成的轨迹要求模型与环境交互、检视自身输出,并进行迭代式改进,形成“生成-观察-修正”的闭环。官方展示案例中,GLM-5.3-Flash在Blender中自主运行16小时,未使用任何外部素材,从零搭建了一套约400平方米的专业主厨自宅与测试厨房。该任务需要将几何、材质、光照与空间知识转化为在不同视角下保持一致的3D结构,模型需自行判断何时查看渲染结果,再根据所见决定后续操作。另一个展示案例为复刻游戏《泰拉瑞亚》,从图像到可运行工程,展示了一个不仅能写代码、还能“看懂”自身产出的模型。
GLM-5.3-Flash的部署环境同样值得关注。过去一周,智谱首次尝试用大规模国产芯片集群直接承载来自全球开发者的真实线上负载。官方未确认具体供应商及芯片数量,但据部分媒体报道,其调用超过10万张国产芯片,算力供应商或来自华为、摩尔线程与海光,有知情人士透露训练或由海光DCU等国产芯片支持。可以确认的是,Ox-Alpha在OpenCode和OpenRouter上的所有请求流量全部由国产芯片提供算力支持。这是一次持续的真实压力测试,用户仅根据速度、稳定性和效果决定是否继续调用,最终Ox-Alpha成为两个平台上当周调用冠军。
国产芯片跑前沿大模型面临内存容量和带宽瓶颈,而GLM-5.3-Flash原生支持最长1M上下文,对显存和通信提出更高要求。智谱的解决方案是在SGLang基础上构建专用推理引擎,并进行激进的内存优化,包括节点内张量并行、ReplaySSM、W8A8量化、INT8/FP8/BF16混合缓存量化及Layer Split等技术,核心思路是“以算力换带宽、以通信换显存”。在集群层面,智谱采用Encode-Prefill-Decode分离式架构,多模态编码、Prefill与Decode阶段分别处理,以提升整体推理效率。
GLM-5.3-Flash的发布在模型能力、定价策略与算力基础设施三个维度同时推进。其以低价格提供接近旗舰模型的能力,可能对当前大模型定价体系产生冲击;原生多模态能力的引入,将视觉反馈纳入编程闭环,拓展了模型在开发工具领域的应用场景;而全量国产芯片承载全球真实负载,则验证了国产算力支撑前沿模型推理的可行性。这三条线的交汇,或将影响后续大模型厂商在技术路线与商业模式上的选择。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。