DeepSeek V4.1 Flash正式上线:552B MoE模型推理成本大幅下降,同步下调API价?

通常来说,又小又快的模型性能也就越低。然而V4.1 Flash不一样,各项基准全面超越V4 Pro,GPQA Diamond达90.9。

DeepSeek测试V4.1 Flash中间版两天后,该模型于9月10日正式上线。这是一款总参数552B的MoE模型,采用全新的Causal-Encoder-Decoder非对称结构,输入激活仅8B、输出激活16B,推理成本大幅低于同尺寸模型。模型原生支持多模态视觉理解,无需外挂视觉模块,并通过KV Cache压缩将显存需求降至上一代的1/4、SSD需求降至1/8。社区实测输出速度达到300至500 tokens/秒。

性能方面,V4.1 Flash各项基准全面超越V4 Pro,其中GPQA Diamond得分达到90.9。通常小尺寸快速模型的性能会有所折损,但V4.1 Flash并未遵循这一规律。价格方面,9月10日12:00起,Flash闲时缓存命中输入为0.02元、未命中1元、输出4元/百万token,高峰时段翻倍。此前缓存命中为0.05元、未命中1.5元、输出4.5元/百万token,整体价格明显下调。

DeepSeek方面此前透露,V4 Pro的调用将逐步转移至性能更高、速度更快的V4.1 Flash,价格也按Flash标准计算。由于Pro的价格是Flash的3倍,此次调整对高频调用用户而言成本降幅显著。

此次调价与模型切换,发生在AI大模型厂商围绕用户额度展开竞争的背景下。在模型性能差距收窄的阶段,API定价与调用额度正在成为厂商争夺开发者的重要手段。OpenAI的Codex团队此前通过多次重置用户额度维持社区活跃度,谷歌AI Studio则以高免费额度吸引开发者。DeepSeek此次以更低价格和更高性能的Flash模型承接Pro调用,进一步加剧了API市场的价格竞争。

对于依赖大模型API的企业和开发者而言,V4.1 Flash的上线意味着在同等预算下可获得更高的调用量和更快的响应速度。随着头部厂商在模型性能与调用成本上持续加码,API市场的竞争重心正从单纯的参数规模转向性价比与工程效率。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
上汽大众推出 ID. ERA 5S 安心交付承诺:超期 1 天可获 100 元等值 V 豆补偿,累计补偿最多 30 天
上一篇 2小时前
美国律师因使用ChatGPT生成虚假证词文书被罚5000美元
下一篇 2小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部