
学术派量化天花板:每个张量单独分配精度,同体积比Unsloth高10分,论文代码全公开可自己复刻
一句话:同一个 Qwen3.8-27B,它用一半的体积跑出 BF16 的分数
本地跑大模型,量化版本满天飞,但绝大多数是"一刀切"——所有层用同一个位宽,敏感的层被误伤,不敏感的层浪费体积。GSQ-RCO 是目前同体积下精度的天花板:奥地利科学技术研究所(ISTA)DASLab 实验室出品,给模型里每一个张量单独分配量化精度,分多少、压多狠,全靠梯度算出来,不拍脑袋。
差异化在哪:两项技术,各司其职
- GSQ(Gumbel-Softmax Quantization)负责"压得好":训练后标量量化,在离散网格上直接学习最优量化值,2~3 bit 下追平一向碾压标量法的向量量化,但产物仍是标准 GGUF,llama.cpp / Ollama / LM Studio 原样跑
- RCO(Riemannian Constrained Optimization)负责"分得准":把"总体积不能超过 X GB"这个硬约束变成黎曼流形上的梯度优化,全程精确满足预算,不用调惩罚系数
别家的"动态量化"是经验调参,GSQ-RCO 是把搜索和量化器都变成可学习的——这是它和普通 imatrix 量化的本质区别。
Qwen3.8-27B 实测成绩(官方模型卡数据)
| 版本 | 位宽 | 体积 | 表现 |
|---|---|---|---|
| IQ2_XS | 2.50 bpw | 8.4 GB | zero-shot 反超 BF16 基线 |
| IQ2_S | 2.75 bpw | 9.3 GB | AIME25 满分追平原模型 |
| IQ3_XXS | 3.00 bpw | 10.1 GB | 均衡之选 |
| IQ3_S | 3.50 bpw | 11.8 GB | task-lossless,推荐主力 |
同 8.4GB 体积对比 Unsloth UD-IQ2_S:AIME25 +10 分、GPQA-Diamond +8.6、LiveCodeBench +4.6。11.8GB 跑出 54GB BF16 的分数,27B 正式进 16G 显存/MacBook 的射程。
论文代码全公开,可以自己复刻
- GSQ:arXiv 2604.18556 | github.com/IST-DASLab/GSQ(Apache 2.0)
- RCO:arXiv 2605.00649 | github.com/IST-DASLab/RCO
论文里还有个很有意思的实验:拿 Unsloth 的 GGUF 当初始值再优化,Qwen3-8B 的 Q2_K 平均分从 50.03 拉到 56.28——方法公开意味着你可以用它量化任何自己想要的模型。
怎么选
- 要同体积极限精度(评测、研究、榨干小显存)→ GSQ-RCO
- 要开箱即用的生态和速度(Flash Attention 加速、MTP 投机解码、全工具链)→ Unsloth Dynamic
两者都是标准 GGUF,可以都下下来切着用。下载:hf download ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF
暂无评论
