GSQ-RCO:ISTA研究所的非均匀量化,11.8GB跑出BF16满分的Qwen3.8-27B

GSQ-RCO:ISTA研究所的非均匀量化,11.8GB跑出BF16满分的Qwen3.8-27B


学术派量化天花板:每个张量单独分配精度,同体积比Unsloth高10分,论文代码全公开可自己复刻

一句话:同一个 Qwen3.8-27B,它用一半的体积跑出 BF16 的分数

本地跑大模型,量化版本满天飞,但绝大多数是"一刀切"——所有层用同一个位宽,敏感的层被误伤,不敏感的层浪费体积。GSQ-RCO 是目前同体积下精度的天花板:奥地利科学技术研究所(ISTA)DASLab 实验室出品,给模型里每一个张量单独分配量化精度,分多少、压多狠,全靠梯度算出来,不拍脑袋。

差异化在哪:两项技术,各司其职

  • GSQ(Gumbel-Softmax Quantization)负责"压得好":训练后标量量化,在离散网格上直接学习最优量化值,2~3 bit 下追平一向碾压标量法的向量量化,但产物仍是标准 GGUF,llama.cpp / Ollama / LM Studio 原样跑
  • RCO(Riemannian Constrained Optimization)负责"分得准":把"总体积不能超过 X GB"这个硬约束变成黎曼流形上的梯度优化,全程精确满足预算,不用调惩罚系数

别家的"动态量化"是经验调参,GSQ-RCO 是把搜索和量化器都变成可学习的——这是它和普通 imatrix 量化的本质区别。

Qwen3.8-27B 实测成绩(官方模型卡数据)

版本位宽体积表现
IQ2_XS2.50 bpw8.4 GBzero-shot 反超 BF16 基线
IQ2_S2.75 bpw9.3 GBAIME25 满分追平原模型
IQ3_XXS3.00 bpw10.1 GB均衡之选
IQ3_S3.50 bpw11.8 GBtask-lossless,推荐主力

同 8.4GB 体积对比 Unsloth UD-IQ2_S:AIME25 +10 分、GPQA-Diamond +8.6、LiveCodeBench +4.6。11.8GB 跑出 54GB BF16 的分数,27B 正式进 16G 显存/MacBook 的射程。

论文代码全公开,可以自己复刻

论文里还有个很有意思的实验:拿 Unsloth 的 GGUF 当初始值再优化,Qwen3-8B 的 Q2_K 平均分从 50.03 拉到 56.28——方法公开意味着你可以用它量化任何自己想要的模型。

怎么选

  • 要同体积极限精度(评测、研究、榨干小显存)→ GSQ-RCO
  • 要开箱即用的生态和速度(Flash Attention 加速、MTP 投机解码、全工具链)→ Unsloth Dynamic

两者都是标准 GGUF,可以都下下来切着用。下载:hf download ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF

6000举报0子龙•5天前
点击获取 ^_^
被收录:

暂无评论