# NInfer - 只认RTX 5090的Qwen3.8-27B极限推理引擎(从零手搓CUDA,单卡并发破千tok/s) > 从零手搓的C++/CUDA推理引擎,只认RTX 5090一张卡:Qwen3.8-27B八路并发767 tok/s、AIME双96.7%不掉点,240K上下文还能看图看视频,5090党的天花板玩法。 antirez 的 DwarfStar 4 走的是「一个引擎深耕一个模型」路线,这个 NInfer 更狠——**只认 RTX 5090 一张卡**。从零写的 C++/CUDA 推理引擎(不依赖 llama.cpp/vLLM),专为 Qwen3.6/3.8 Dense + MoE 做极限单卡优化,Blackwell sm_120a 的算子直接手搓,CMake 里写死其他架构直接拒绝编译。 ## 跑分有多离谱(RTX 5090 实测) | 模型 | 单路解码 | 8 路并发 | 结构化输出 MTP3 | |---|---:|---:|---:| | Qwen3.6-27B nvfp4 | 202 tok/s | **1147 tok/s**(5.67× 扩展) | 252 tok/s | | Qwen3.8-27B nvfp4 | 144 tok/s | **767 tok/s**(5.33× 扩展) | 220 tok/s | | Qwen3.6-35B-A3B | 643 tok/s | **1381 tok/s** | **780 tok/s** | MoE 的 35B-A3B 更夸张:短 prefill 冲到 **17705 tok/s**,26 万 token 长 prefill 也有 5247 tok/s。并发扩展效率能做到 5.67 倍(8 路),说明 KV 和调度是真下了功夫。 ## 能力没为速度买单 官方用自家 serving 路由 + MTP3 跑的评测:Qwen3.8-27B NVFP4 拿下 **AIME2025/2026 双 96.67%**、GPQA-Diamond 90.40%——基本是满血水平,量化+投机解码没伤到推理筋骨。 ## 功能面 - **240K 上下文**(262K 逻辑上限),FP8/INT8 KV cache,CUDA Graphs - **MTP3 投机解码**(68-71% 接受率),35B-A3B 还支持 DFlash - **能看图能看视频**:`--vision` 挂载多模态,走 OpenAI 兼容接口直接传 - OpenAI **和** Anthropic 双兼容 API + CLI,Claude Code/opencode 可直接指过来 - 前缀 checkpoint 跨请求复用:Device/Host 两级 KV 池 + 逐出调度,长文档多轮场景 TTFT 友好 ## ⚠️ 门槛别忽视 1. **只支持 RTX 5090**(sm_120a),4090/5080 都不行,编译期直接拒绝 2. **Linux only**,要自己编译(CUDA 13.1 验证过),没有预编译二进制,无 install 目标,跑在源码树里 3. 模型是官方转换好的 `.ninfer` 工件(v3 格式,[HF 上有 5 个](https://huggingface.co/neroued)),自己的权重要跑转换工具 4. 显存管理是启动时定死的容量制(1-8 路并发),不是动态伸缩 有 5090 的这是目前 Qwen3.8-27B 单卡天花板级玩法;没有的话看看就行,它连兼容性fallback都懒得做——就是这么专。 顺带一提:同一颗 Qwen3.8-27B 还有 [Bonsai 2 三值压缩版](https://octohz.com/p/2156)(5.9GB 笔记本跑),5090 党选 NInfer 榨性能,轻薄本党选 Bonsai 2 省内存。 --- **分类**:程序员 **标签**:tok · 27B · Qwen3.8 **作者**:子龙 **链接**:https://octohz.com/p/2158