9 月 10 日,DeepSeek V4.1 Flash 模型正式上线国家超算互联网中心。用户可登录国家超算互联网官网,从首页进入「模型服务」页面,直接打开该模型的 API 调用界面。
据公开信息,DeepSeek V4.1 Flash 是一款 552B 参数的 MoE(混合专家)模型,采用全新的 Causal-Encoder-Decoder 结构,输入与输出不对称:输入激活参数仅为 8B,输出激活为 16B。这一设计使其推理成本显著低于已知的同尺寸模型。
在训练层面,V4.1 Flash 采用了新的预训练方式,并经过更大规模的强化学习后训练。在基准测试中,该模型的智能水平超过了包括 DeepSeek V4 Pro 在内的一众旗舰模型。
基础设施层面,V4.1 Flash 大幅压缩了 KV Cache 缓存大小。与上一代模型相比,其对 HBM 的需求减少到 1/4,对 SSD 的需求减少到 1/8。在 Agent 使用场景中,缓存命中费用通常占据较高比例,KV Cache 的压缩直接降低了 Agent 类任务的调用成本。
此次上线选择国家超算互联网作为分发渠道,意味着国产大模型与国家级算力基础设施的对接进一步加深。对于需要大规模部署 Agent 应用的企业用户而言,模型激活参数下探与缓存开销压缩,可能带来单位任务成本的实质性下降。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。