PrismML 发布三值量化模型 Bonsai 2 27B,5.9GB 内存占用保留基础模型 98.2% 性能

该模型以不到 1/9 的内存占用在综合基准测试中得到了基础模型 98.2% 的分数,整体表现甚至好于 Qwen3.6 27B。

人工智能实验室 PrismML 于当地时间 27 日宣布推出三值量化版本的 Bonsai 2 27B。该模型将基础模型从上一代的 Qwen3.6 27B 升级至 Qwen3.8 27B,在推理、编程、视觉及长程智能体等维度的性能全面提升,并以不到 1/9 的内存占用在综合基准测试中取得基础模型 98.2% 的分数,整体表现超过 Qwen3.6 27B。

PrismML 今年早些时候曾推出微调模型 Bonsai 27B,以显著更低的内存占用实现了 Qwen3.6 27B 基础模型 95% 的性能。此次发布的 Bonsai 2 27B 采用三值量化方案,配合 FP16 分组缩放,每个权重的有效比特为 1.76,模型总大小为 5.9GB,支持 262K 上下文窗口。这一体积使得模型可在本地设备上运行,同时保留接近全精度基础模型的能力。

在硬件性能方面,Bonsai 2 27B 在 NVIDIA GeForce RTX 5090 上实现 143TPS 的词元吞吐量,在 Apple Silicon M5 Max 上可达 46.8TPS。能效方面,该模型在 GeForce RTX 4090 上的功耗为 0.714mWh/Token,比全精度 8B 模型低 40%。模型可通过 CUDA 在 NVIDIA GPU 上运行,也可通过 MLX 在 Apple 设备上运行,并以 Apache 2.0 许可证开放权重。

PrismML 表示,Bonsai 2 27B 足以在本地承担编程智能体循环、计算机使用工作流、私有文档解析、多模态调试及混合编排等知识工作负载,仅在需要时才调用云端 API。这一发布延续了 AI 模型小型化与本地化部署的趋势,在端侧算力有限的前提下,为开发者和企业提供了兼顾性能与隐私的推理选项。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
荣耀发布行业解决方案品牌荣耀天工,推出AI工作站等商用硬件产品
上一篇 4小时前
Meta推出WhatsApp Business MCP服务器,支持AI编程代理自动化配置流程
下一篇 2天前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部