# GSQ-RCO:ISTA研究所的非均匀量化,11.8GB跑出BF16满分的Qwen3.8-27B > 学术派量化天花板:每个张量单独分配精度,同体积比Unsloth高10分,论文代码全公开可自己复刻 ## 一句话:同一个 Qwen3.8-27B,它用一半的体积跑出 BF16 的分数 本地跑大模型,量化版本满天飞,但绝大多数是"一刀切"——所有层用同一个位宽,敏感的层被误伤,不敏感的层浪费体积。**GSQ-RCO 是目前同体积下精度的天花板**:奥地利科学技术研究所(ISTA)DASLab 实验室出品,给模型里每一个张量单独分配量化精度,分多少、压多狠,全靠梯度算出来,不拍脑袋。 ## 差异化在哪:两项技术,各司其职 - **GSQ(Gumbel-Softmax Quantization)负责"压得好"**:训练后标量量化,在离散网格上直接学习最优量化值,2~3 bit 下追平一向碾压标量法的向量量化,但产物仍是标准 GGUF,llama.cpp / Ollama / LM Studio 原样跑 - **RCO(Riemannian Constrained Optimization)负责"分得准"**:把"总体积不能超过 X GB"这个硬约束变成黎曼流形上的梯度优化,全程精确满足预算,不用调惩罚系数 别家的"动态量化"是经验调参,GSQ-RCO 是把搜索和量化器**都变成可学习**的——这是它和普通 imatrix 量化的本质区别。 ## Qwen3.8-27B 实测成绩(官方模型卡数据) | 版本 | 位宽 | 体积 | 表现 | |---|---|---|---| | IQ2_XS | 2.50 bpw | 8.4 GB | zero-shot 反超 BF16 基线 | | IQ2_S | 2.75 bpw | 9.3 GB | AIME25 满分追平原模型 | | IQ3_XXS | 3.00 bpw | 10.1 GB | 均衡之选 | | **IQ3_S** | 3.50 bpw | 11.8 GB | **task-lossless,推荐主力** | 同 8.4GB 体积对比 Unsloth UD-IQ2_S:**AIME25 +10 分、GPQA-Diamond +8.6、LiveCodeBench +4.6**。11.8GB 跑出 54GB BF16 的分数,27B 正式进 16G 显存/MacBook 的射程。 ## 论文代码全公开,可以自己复刻 - GSQ:[arXiv 2604.18556](https://arxiv.org/abs/2604.18556) | [github.com/IST-DASLab/GSQ](https://github.com/IST-DASLab/GSQ)(Apache 2.0) - RCO:[arXiv 2605.00649](https://arxiv.org/abs/2605.00649) | [github.com/IST-DASLab/RCO](https://github.com/IST-DASLab/RCO) 论文里还有个很有意思的实验:拿 Unsloth 的 GGUF 当初始值再优化,Qwen3-8B 的 Q2_K 平均分从 50.03 拉到 56.28——方法公开意味着你可以用它量化任何自己想要的模型。 ## 怎么选 - 要**同体积极限精度**(评测、研究、榨干小显存)→ GSQ-RCO - 要**开箱即用的生态和速度**(Flash Attention 加速、MTP 投机解码、全工具链)→ Unsloth Dynamic 两者都是标准 GGUF,可以都下下来切着用。下载:`hf download ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF` --- **分类**:软件 **标签**:量化 · GSQ · RCO **作者**:子龙 **链接**:https://octohz.com/p/2172