
发布3天下载破150万!54GB的Qwen3.8-27B压到5.9GB还留98.2%智力,传统2bit崩掉的数学题它守住95分,低比特本地部署天花板。
Prism ML 刚发的 Bonsai 2 27B,可能是目前本地部署圈最值得盯的一个模型:把 Qwen3.8-27B(FP16 要 54GB)用三值权重压到 5.9GB,还保住 98.2% 的智力——不是事后量化,是权重直接训练成 {-1, 0, +1} 三值,真·1.72 bit/weight,不玩虚标。发布三天下载破 150 万。
压得有多狠
| 变体 | 真实位宽 | 体积 | 14 项基准平均 | vs FP16 |
|---|---|---|---|---|
| Qwen3.8-27B FP16 | 16.0 | 54 GB | 86.32 | 100% |
| UD-Q4_K_XL("4bit") | 5.2 | 17.6 GB | 85.18 | 98.7% |
| IQ2_XXS("2bit") | 2.8 | 9.4 GB | 72.59 | 84.1% |
| Bonsai 2 27B | 1.72 | 5.9 GB | 84.78 | 98.2% |
传统 2bit 量化崩掉的地方它全守住了:AIME26 数学竞赛 95.8 分(传统 IQ2_XXS 只有 57.5)、LiveCodeBench 90.1(对手 56.4)、数学整体距满血只差 0.5 分。差距集中在知识和视觉类,属于可接受的代价。
几个硬核点
- 262K 上下文:75% 线性注意力(GatedDeltaNet)+ 25% 全注意力的混合架构,长上下文在端侧才真正可用
- 默认 xhigh 深度思考的推理模型,工具调用、Agent 行为全保留
- 能看图:0.63GB 的 mmproj 视觉塔选配挂载,纯文本服务不占内存
- 速度夸张:RTX 5090 跑到 130 tok/s,4090 也有 81-91,Mac M5 Max 47 tok/s(整机功耗才 34W)
⚠️ 上手前必看
- 原版 llama.cpp 跑不了:必须用 PrismML 的 fork,三元混合注意力 kernel 在里面。最阴险的是原版加载它的 Q2_0 文件不报错但输出全是乱码(缺 Hadamard 变换)
- MLX 版同样要专用 runtime,普通 MLX 加载器跑不了(omlx/LM Studio 都不行)
- 跑法直接抄官方 Bonsai-demo 仓库,有锁定版本的预编译二进制
下载:GGUF 版(PTQ1_0 5.95GB / PQ2_0 7.21GB 两档,PQ2_0 综合更快)· MLX 版(8.6GB 含视觉塔)· Apache 2.0 随便商用。
顺带一提:无审查圈已经跟上——dealignai 的 CRACK 版(权重级 abliterated,HarmBench 拒答率 93.44% → 0%)9-18 刚修复早期 token 循环 bug,要下最新的。
暂无评论
