人工智能实验室 PrismML 于当地时间 27 日宣布推出三值量化版本的 Bonsai 2 27B。该模型将基础模型从上一代的 Qwen3.6 27B 升级至 Qwen3.8 27B,在推理、编程、视觉及长程智能体等维度的性能全面提升,并以不到 1/9 的内存占用在综合基准测试中取得基础模型 98.2% 的分数,整体表现超过 Qwen3.6 27B。
PrismML 今年早些时候曾推出微调模型 Bonsai 27B,以显著更低的内存占用实现了 Qwen3.6 27B 基础模型 95% 的性能。此次发布的 Bonsai 2 27B 采用三值量化方案,配合 FP16 分组缩放,每个权重的有效比特为 1.76,模型总大小为 5.9GB,支持 262K 上下文窗口。这一体积使得模型可在本地设备上运行,同时保留接近全精度基础模型的能力。
在硬件性能方面,Bonsai 2 27B 在 NVIDIA GeForce RTX 5090 上实现 143TPS 的词元吞吐量,在 Apple Silicon M5 Max 上可达 46.8TPS。能效方面,该模型在 GeForce RTX 4090 上的功耗为 0.714mWh/Token,比全精度 8B 模型低 40%。模型可通过 CUDA 在 NVIDIA GPU 上运行,也可通过 MLX 在 Apple 设备上运行,并以 Apache 2.0 许可证开放权重。
PrismML 表示,Bonsai 2 27B 足以在本地承担编程智能体循环、计算机使用工作流、私有文档解析、多模态调试及混合编排等知识工作负载,仅在需要时才调用云端 API。这一发布延续了 AI 模型小型化与本地化部署的趋势,在端侧算力有限的前提下,为开发者和企业提供了兼顾性能与隐私的推理选项。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。