开发者开源Strata推理引擎,12GB显存消费级显卡可运行125B参数Qwen模型

Strata为了降低显存占用,主要采用两项关键技术:其一是将MoE(混合专家)模型整体载入RAM,仅将高频使用的专家模型载入VRAM。其二使用轻量模型进行投机解码,预测下一Token以加速推理过程。

开发者Niko1221近日开源推出Strata推理引擎,可在12GB及以上显存的消费级显卡上运行量化后的Qwen3.8-Flash-Next模型。该模型为阿里巴巴Qwen团队于2026年8月推出的多模态混合专家(MoE)模型压缩版本,拥有1250亿参数,另含510亿参数的n-gram嵌入表,原生支持262K token上下文长度。

为降低显存占用,Strata采用两项关键技术:一是将MoE模型整体载入系统内存,仅将高频使用的专家模型载入VRAM;二是使用轻量模型进行投机解码,预测下一Token以加速推理过程。这一方案使得大参数模型在消费级硬件上的部署成为可能。

硬件要求方面,运行Qwen3.8-Flash-Next需满足最低配置:12GB以上VRAM的NVIDIA或AMD显卡、32GB以上系统内存、80GB以上存储空间(推荐SSD),以及Windows 10/11或Linux操作系统。

性能测试数据显示,在NVIDIA GeForce RTX 5070(12GB VRAM)、Ryzen 5 7600、64GB RAM配置下,2比特量化版Q2_0达到94词元/秒的生成速度,阅读提示速度达2650词元/秒;3比特量化版IQ3_S生成速度为53词元/秒,阅读提示速度为1620词元/秒。在AMD Radeon RX 9070 XT(16GB VRAM)环境下,Q2_0版本生成速度为60词元/秒,阅读提示速度为1160词元/秒。

该引擎的开源为本地部署大参数模型提供了新的技术路径,有望降低企业和开发者使用高性能MoE模型的门槛。目前项目已在GitHub上线。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

赞 (0)
Integrate 推出 MCP 连接器,将营销数据治理能力嵌入企业现有 AI 工作流
上一篇 2小时前
Roster推出Instagram创作者发现与Meta合作广告功能,打通红人营销全链路
下一篇 2小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部