
从零手搓的C++/CUDA推理引擎,只认RTX 5090一张卡:Qwen3.8-27B八路并发767 tok/s、AIME双96.7%不掉点,240K上下文还能看图看视频,5090党的天花板玩法。
antirez 的 DwarfStar 4 走的是「一个引擎深耕一个模型」路线,这个 NInfer 更狠——只认 RTX 5090 一张卡。从零写的 C++/CUDA 推理引擎(不依赖 llama.cpp/vLLM),专为 Qwen3.6/3.8 Dense + MoE 做极限单卡优化,Blackwell sm_120a 的算子直接手搓,CMake 里写死其他架构直接拒绝编译。
跑分有多离谱(RTX 5090 实测)
| 模型 | 单路解码 | 8 路并发 | 结构化输出 MTP3 |
|---|---|---|---|
| Qwen3.6-27B nvfp4 | 202 tok/s | 1147 tok/s(5.67× 扩展) | 252 tok/s |
| Qwen3.8-27B nvfp4 | 144 tok/s | 767 tok/s(5.33× 扩展) | 220 tok/s |
| Qwen3.6-35B-A3B | 643 tok/s | 1381 tok/s | 780 tok/s |
MoE 的 35B-A3B 更夸张:短 prefill 冲到 17705 tok/s,26 万 token 长 prefill 也有 5247 tok/s。并发扩展效率能做到 5.67 倍(8 路),说明 KV 和调度是真下了功夫。
能力没为速度买单
官方用自家 serving 路由 + MTP3 跑的评测:Qwen3.8-27B NVFP4 拿下 AIME2025/2026 双 96.67%、GPQA-Diamond 90.40%——基本是满血水平,量化+投机解码没伤到推理筋骨。
功能面
- 240K 上下文(262K 逻辑上限),FP8/INT8 KV cache,CUDA Graphs
- MTP3 投机解码(68-71% 接受率),35B-A3B 还支持 DFlash
- 能看图能看视频:
--vision挂载多模态,走 OpenAI 兼容接口直接传 - OpenAI 和 Anthropic 双兼容 API + CLI,Claude Code/opencode 可直接指过来
- 前缀 checkpoint 跨请求复用:Device/Host 两级 KV 池 + 逐出调度,长文档多轮场景 TTFT 友好
⚠️ 门槛别忽视
- 只支持 RTX 5090(sm_120a),4090/5080 都不行,编译期直接拒绝
- Linux only,要自己编译(CUDA 13.1 验证过),没有预编译二进制,无 install 目标,跑在源码树里
- 模型是官方转换好的
.ninfer工件(v3 格式,HF 上有 5 个),自己的权重要跑转换工具 - 显存管理是启动时定死的容量制(1-8 路并发),不是动态伸缩
有 5090 的这是目前 Qwen3.8-27B 单卡天花板级玩法;没有的话看看就行,它连兼容性fallback都懒得做——就是这么专。
顺带一提:同一颗 Qwen3.8-27B 还有 Bonsai 2 三值压缩版(5.9GB 笔记本跑),5090 党选 NInfer 榨性能,轻薄本党选 Bonsai 2 省内存。
暂无评论
