Bonsai 2 27B - 54GB压到5.9GB还留98%智力的三值模型(Qwen3.8-27B官方压缩,笔记本能跑满血27B推理)

Bonsai 2 27B - 54GB压到5.9GB还留98%智力的三值模型(Qwen3.8-27B官方压缩,笔记本能跑满血27B推理)


发布3天下载破150万!54GB的Qwen3.8-27B压到5.9GB还留98.2%智力,传统2bit崩掉的数学题它守住95分,低比特本地部署天花板。

Prism ML 刚发的 Bonsai 2 27B,可能是目前本地部署圈最值得盯的一个模型:把 Qwen3.8-27B(FP16 要 54GB)用三值权重压到 5.9GB,还保住 98.2% 的智力——不是事后量化,是权重直接训练成 {-1, 0, +1} 三值,真·1.72 bit/weight,不玩虚标。发布三天下载破 150 万。

压得有多狠

变体真实位宽体积14 项基准平均vs FP16
Qwen3.8-27B FP1616.054 GB86.32100%
UD-Q4_K_XL("4bit")5.217.6 GB85.1898.7%
IQ2_XXS("2bit")2.89.4 GB72.5984.1%
Bonsai 2 27B1.725.9 GB84.7898.2%

传统 2bit 量化崩掉的地方它全守住了:AIME26 数学竞赛 95.8 分(传统 IQ2_XXS 只有 57.5)、LiveCodeBench 90.1(对手 56.4)、数学整体距满血只差 0.5 分。差距集中在知识和视觉类,属于可接受的代价。

几个硬核点

  • 262K 上下文:75% 线性注意力(GatedDeltaNet)+ 25% 全注意力的混合架构,长上下文在端侧才真正可用
  • 默认 xhigh 深度思考的推理模型,工具调用、Agent 行为全保留
  • 能看图:0.63GB 的 mmproj 视觉塔选配挂载,纯文本服务不占内存
  • 速度夸张:RTX 5090 跑到 130 tok/s,4090 也有 81-91,Mac M5 Max 47 tok/s(整机功耗才 34W)

⚠️ 上手前必看

  1. 原版 llama.cpp 跑不了:必须用 PrismML 的 fork,三元混合注意力 kernel 在里面。最阴险的是原版加载它的 Q2_0 文件不报错但输出全是乱码(缺 Hadamard 变换)
  2. MLX 版同样要专用 runtime,普通 MLX 加载器跑不了(omlx/LM Studio 都不行)
  3. 跑法直接抄官方 Bonsai-demo 仓库,有锁定版本的预编译二进制

下载:GGUF 版(PTQ1_0 5.95GB / PQ2_0 7.21GB 两档,PQ2_0 综合更快)· MLX 版(8.6GB 含视觉塔)· Apache 2.0 随便商用。

顺带一提:无审查圈已经跟上——dealignai 的 CRACK 版(权重级 abliterated,HarmBench 拒答率 93.44% → 0%)9-18 刚修复早期 token 循环 bug,要下最新的。

3600举报0子龙•8天前
点击获取 ^_^
被收录:

暂无评论