# Bonsai 2 27B - 54GB压到5.9GB还留98%智力的三值模型(Qwen3.8-27B官方压缩,笔记本能跑满血27B推理) > 发布3天下载破150万!54GB的Qwen3.8-27B压到5.9GB还留98.2%智力,传统2bit崩掉的数学题它守住95分,低比特本地部署天花板。 Prism ML 刚发的 Bonsai 2 27B,可能是目前本地部署圈最值得盯的一个模型:把 Qwen3.8-27B(FP16 要 54GB)用三值权重压到 **5.9GB**,还保住 98.2% 的智力——不是事后量化,是权重直接训练成 {-1, 0, +1} 三值,真·1.72 bit/weight,不玩虚标。发布三天下载破 150 万。 ## 压得有多狠 | 变体 | 真实位宽 | 体积 | 14 项基准平均 | vs FP16 | |---|---:|---:|---:|---:| | Qwen3.8-27B FP16 | 16.0 | 54 GB | 86.32 | 100% | | UD-Q4_K_XL("4bit") | 5.2 | 17.6 GB | 85.18 | 98.7% | | IQ2_XXS("2bit") | 2.8 | 9.4 GB | 72.59 | 84.1% | | **Bonsai 2 27B** | **1.72** | **5.9 GB** | **84.78** | **98.2%** | 传统 2bit 量化崩掉的地方它全守住了:AIME26 数学竞赛 95.8 分(传统 IQ2_XXS 只有 57.5)、LiveCodeBench 90.1(对手 56.4)、数学整体距满血只差 0.5 分。差距集中在知识和视觉类,属于可接受的代价。 ## 几个硬核点 - **262K 上下文**:75% 线性注意力(GatedDeltaNet)+ 25% 全注意力的混合架构,长上下文在端侧才真正可用 - **默认 xhigh 深度思考**的推理模型,工具调用、Agent 行为全保留 - **能看图**:0.63GB 的 mmproj 视觉塔选配挂载,纯文本服务不占内存 - **速度夸张**:RTX 5090 跑到 130 tok/s,4090 也有 81-91,Mac M5 Max 47 tok/s(整机功耗才 34W) ## ⚠️ 上手前必看 1. **原版 llama.cpp 跑不了**:必须用 [PrismML 的 fork](https://github.com/PrismML-Eng/llama.cpp),三元混合注意力 kernel 在里面。最阴险的是原版加载它的 Q2_0 文件不报错但输出全是乱码(缺 Hadamard 变换) 2. **MLX 版同样要专用 runtime**,普通 MLX 加载器跑不了(omlx/LM Studio 都不行) 3. 跑法直接抄官方 [Bonsai-demo 仓库](https://github.com/PrismML-Eng/Bonsai-demo),有锁定版本的预编译二进制 下载:[GGUF 版](https://huggingface.co/prism-ml/Ternary-Bonsai-2-27B-gguf)(PTQ1_0 5.95GB / PQ2_0 7.21GB 两档,PQ2_0 综合更快)· [MLX 版](https://huggingface.co/prism-ml/Ternary-Bonsai-2-27B-mlx-2bit)(8.6GB 含视觉塔)· Apache 2.0 随便商用。 顺带一提:无审查圈已经跟上——dealignai 的 CRACK 版(权重级 abliterated,HarmBench 拒答率 93.44% → 0%)9-18 刚修复早期 token 循环 bug,要下最新的。 --- **分类**:模型 **标签**:GB · 27B · Bonsai **作者**:子龙 **链接**:https://octohz.com/p/2156