NInfer - 只认RTX 5090的Qwen3.8-27B极限推理引擎(从零手搓CUDA,单卡并发破千tok/s)

NInfer - 只认RTX 5090的Qwen3.8-27B极限推理引擎(从零手搓CUDA,单卡并发破千tok/s)


从零手搓的C++/CUDA推理引擎,只认RTX 5090一张卡:Qwen3.8-27B八路并发767 tok/s、AIME双96.7%不掉点,240K上下文还能看图看视频,5090党的天花板玩法。

antirez 的 DwarfStar 4 走的是「一个引擎深耕一个模型」路线,这个 NInfer 更狠——只认 RTX 5090 一张卡。从零写的 C++/CUDA 推理引擎(不依赖 llama.cpp/vLLM),专为 Qwen3.6/3.8 Dense + MoE 做极限单卡优化,Blackwell sm_120a 的算子直接手搓,CMake 里写死其他架构直接拒绝编译。

跑分有多离谱(RTX 5090 实测)

模型单路解码8 路并发结构化输出 MTP3
Qwen3.6-27B nvfp4202 tok/s1147 tok/s(5.67× 扩展)252 tok/s
Qwen3.8-27B nvfp4144 tok/s767 tok/s(5.33× 扩展)220 tok/s
Qwen3.6-35B-A3B643 tok/s1381 tok/s780 tok/s

MoE 的 35B-A3B 更夸张:短 prefill 冲到 17705 tok/s,26 万 token 长 prefill 也有 5247 tok/s。并发扩展效率能做到 5.67 倍(8 路),说明 KV 和调度是真下了功夫。

能力没为速度买单

官方用自家 serving 路由 + MTP3 跑的评测:Qwen3.8-27B NVFP4 拿下 AIME2025/2026 双 96.67%、GPQA-Diamond 90.40%——基本是满血水平,量化+投机解码没伤到推理筋骨。

功能面

  • 240K 上下文(262K 逻辑上限),FP8/INT8 KV cache,CUDA Graphs
  • MTP3 投机解码(68-71% 接受率),35B-A3B 还支持 DFlash
  • 能看图能看视频:--vision 挂载多模态,走 OpenAI 兼容接口直接传
  • OpenAI 和 Anthropic 双兼容 API + CLI,Claude Code/opencode 可直接指过来
  • 前缀 checkpoint 跨请求复用:Device/Host 两级 KV 池 + 逐出调度,长文档多轮场景 TTFT 友好

⚠️ 门槛别忽视

  1. 只支持 RTX 5090(sm_120a),4090/5080 都不行,编译期直接拒绝
  2. Linux only,要自己编译(CUDA 13.1 验证过),没有预编译二进制,无 install 目标,跑在源码树里
  3. 模型是官方转换好的 .ninfer 工件(v3 格式,HF 上有 5 个),自己的权重要跑转换工具
  4. 显存管理是启动时定死的容量制(1-8 路并发),不是动态伸缩

有 5090 的这是目前 Qwen3.8-27B 单卡天花板级玩法;没有的话看看就行,它连兼容性fallback都懒得做——就是这么专。

顺带一提:同一颗 Qwen3.8-27B 还有 Bonsai 2 三值压缩版(5.9GB 笔记本跑),5090 党选 NInfer 榨性能,轻薄本党选 Bonsai 2 省内存。

16700举报0子龙•8天前
点击获取 ^_^
被收录:

暂无评论