开发者Niko1221近日开源推出Strata推理引擎,可在12GB及以上显存的消费级显卡上运行量化后的Qwen3.8-Flash-Next模型。该模型为阿里巴巴Qwen团队于2026年8月推出的多模态混合专家(MoE)模型压缩版本,拥有1250亿参数,另含510亿参数的n-gram嵌入表,原生支持262K token上下文长度。
为降低显存占用,Strata采用两项关键技术:一是将MoE模型整体载入系统内存,仅将高频使用的专家模型载入VRAM;二是使用轻量模型进行投机解码,预测下一Token以加速推理过程。这一方案使得大参数模型在消费级硬件上的部署成为可能。
硬件要求方面,运行Qwen3.8-Flash-Next需满足最低配置:12GB以上VRAM的NVIDIA或AMD显卡、32GB以上系统内存、80GB以上存储空间(推荐SSD),以及Windows 10/11或Linux操作系统。
性能测试数据显示,在NVIDIA GeForce RTX 5070(12GB VRAM)、Ryzen 5 7600、64GB RAM配置下,2比特量化版Q2_0达到94词元/秒的生成速度,阅读提示速度达2650词元/秒;3比特量化版IQ3_S生成速度为53词元/秒,阅读提示速度为1620词元/秒。在AMD Radeon RX 9070 XT(16GB VRAM)环境下,Q2_0版本生成速度为60词元/秒,阅读提示速度为1160词元/秒。
该引擎的开源为本地部署大参数模型提供了新的技术路径,有望降低企业和开发者使用高性能MoE模型的门槛。目前项目已在GitHub上线。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。