标签「tok」共 3 条内容
NInfer - 只认RTX 5090的Qwen3.8-27B极限推理引擎(从零手搓CUDA,单卡并发破千tok/s)程序员

从零手搓的C++/CUDA推理引擎,只认RTX 5090一张卡:Qwen3.8-27B八路并发767 tok/s、AIME双96.7%不掉点,240K上下文还能看图看视频,5090党的天花板玩法。

168000子龙子龙•8天前
M5 Max 实测 Qwen3.8-27B MLX 4bit 并发扩展性:1→32 并行全数据硬件

64GB 统一内存本地跑 27B,252 次请求零报错。低并发看响应,高并发看总量,甜蜜区在 N≤4

106000子龙子龙•28天前
Rapid-MLX - 专为 Apple Silicon 打造的极速本地 AI 引擎MacOS

比 Ollama 快 4.2 倍,17 种工具调用解析器,0.08 秒首字延迟,完整兼容 OpenAI API

198001子龙子龙•4个月前