不只量化更是全链路:Dynamic v3.0动态精度+MTP投机解码+Flash Attention加速,llama.cpp/Ollama一键起
学术派量化天花板:每个张量单独分配精度,同体积比Unsloth高10分,论文代码全公开可自己复刻
同一个模型有 4bit/8bit/免审版,怎么选?一句话:稠密选小、MoE 选大。附下载地址与实测速度;2026-09 补测 oMLX 引擎,修正「换引擎不会变快」的旧结论。
antirez新作:DeepSeek V4 Flash的Metal/CUDA原生推理引擎,2-bit量化128GB Mac跑百万token上下文