从零手搓的C++/CUDA推理引擎,只认RTX 5090一张卡:Qwen3.8-27B八路并发767 tok/s、AIME双96.7%不掉点,240K上下文还能看图看视频,5090党的天花板玩法。
64GB 统一内存本地跑 27B,252 次请求零报错。低并发看响应,高并发看总量,甜蜜区在 N≤4
比 Ollama 快 4.2 倍,17 种工具调用解析器,0.08 秒首字延迟,完整兼容 OpenAI API