智谱上线GLM-5.3-FlashX模型,推理速度最高达200 tokens/s

GLM-5.3-Flash长期保持同尺寸最强智能水平,本次提速进一步形成智能、价格、速度的全面竞争力。

智谱于9月18日宣布推出GLM-5.3-FlashX模型,最高推理速度可达200 tokens/s,面向企业与开发者提供更快的模型调用体验。该模型API已同步上线,Model Key为GLM-5.3-FlashX。

据智谱方面介绍,GLM-5.3-Flash此前以“Ox Alpha”之名面向全球开发者发布,调用量持续攀升。为应对快速增长的需求,智谱在10万张国产芯片提供的推理算力基础上,进一步加大基础设施侧投入与推理优化。官方称,GLM-5.3-Flash长期保持同尺寸最强智能水平,本次提速使其在智能、价格、速度三个维度形成综合竞争力。

定价方面,GLM-5.3-FlashX高于GLM-5.3-Flash。具体来看,GLM-5.3-FlashX上下文长度为1M,输入单价为2元/百万Tokens,输出单价为7元/百万Tokens,缓存命中价格为0.57元/百万Tokens;GLM-5.3-Flash输入单价为0.8元/百万Tokens,输出单价为2.8元/百万Tokens,缓存命中价格为0.23元/百万Tokens。两款模型的缓存存储均限时免费,输入模态均支持图片、视频、文件和文本。作为对比,GLM-5.3的输入单价为8元/百万Tokens,输出单价为28元/百万Tokens,输入模态仅支持文本。

从定价结构看,GLM-5.3-FlashX在GLM-5.3-Flash的基础上提升了输出速度,同时将价格上浮至中档区间,与GLM-5.3形成梯度覆盖。这一策略使智谱在国产大模型API市场中,能够同时面向对成本敏感和对响应速度有更高要求的客户群体。

当前,大模型推理效率正成为厂商竞争的关键指标之一。智谱依托国产芯片算力集群进行推理优化,在一定程度上反映了国产算力在大模型服务环节的承载能力。随着GLM-5.3-FlashX的加入,智谱在模型矩阵上的分层布局进一步清晰,其在企业级AI服务市场的份额争夺也将更趋激烈。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
阿里发布Qwen3.8-Omni-Flash全模态模型,百万Token音视频输入价格降至0.8元
上一篇 4小时前
全国首个海洋Token工厂落地青岛,算力规模超800P
下一篇 2小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部