# M5 Max 实测 Qwen3.8-27B MLX 4bit 并发扩展性:1→32 并行全数据 > 64GB 统一内存本地跑 27B,252 次请求零报错。低并发看响应,高并发看总量,甜蜜区在 N≤4 ## 这是什么 土耳其工程师 Alican Kiraz(Trendyol 高级 Staff 工程师,常驻 MLX 开源社区)在 **MacBook Pro(M5 Max,18 核 CPU / 40 核 GPU,64GB 统一内存)** 上,用 **Qwen3.8-27B MLX 4-bit** 做了一组并发压测:1、2、4、8、16、32 个并行请求,两轮独立测试、每档 4 批、每请求固定 399 输出 token,**252 次请求全部成功、零报错**。 对想买 Mac Studio / MacBook Pro M5 Max(64GB 或 128GB)跑本地大模型的人来说,这是目前很少见的真实并发数据。 ## 完整数据表 | 并发 N | 总吞吐 tok/s | 加速比 | 效率 | 单用户 tok/s | 批次耗时 | 平均 TTFT | 最大 TTFT | |---:|---:|---:|---:|---:|---:|---:|---:| | 1 | 31.96 | 1.00× | 100% | 29.66 | 12.5 s | 0.38 s | 0.38 s | | 2 | 54.78 | 1.71× | 86% | 25.82 | 14.6 s | 0.51 s | 0.63 s | | 4 | 74.79 | 2.34× | 58% | 17.74 | 21.4 s | 0.74 s | 1.06 s | | 8 | 72.18 | 2.26× | 28% | 8.50 | 44.5 s | 1.17 s | 1.97 s | | 16 | 77.36 | 2.42× | 15% | 4.58 | 82.6 s | 2.46 s | 5.43 s | | 32 | 137.50 | 4.30× | 13% | 4.30 | 92.9 s | 5.75 s | 12.81 s | > TTFT = time to first token(首 token 延迟);Per User = 每个并发请求分到的速度。 ## 三个结论 **1、这套配置是稳的。** M5 Max 64GB 本地跑 27B 4-bit,252 次请求全成功零报错,MLX 量化 + continuous batching 在生产强度下没掉链子。 **2、想要"打字就出字",并发控制在 1–4。** N=1 时单用户 29.7 tok/s、TTFT 0.38 秒,实时聊天体验最佳;N=4 时单用户仍有 17.7 tok/s,可接受。 **3、想要"一口气处理很多请求",N=32 总吞吐最高(137.5 tok/s,4.3 倍)。** 适合批处理、后台任务、agent 批量干活,不适合实时聊天——此时 TTFT 平均 5.75 秒、最差 12.8 秒,打字有明显等待感。 ## 补充观察:甜蜜区其实在 N≤4 注意 N=8 的数据:总吞吐 72.18 tok/s 反而比 N=4(74.79)略低,效率却从 58% 暴跌到 28%。也就是说 N=4→8 之间存在一个拐点——再往上堆并发,本质是"拿效率换总量",N=32 的 137.5 tok/s 里有相当部分算力是被调度浪费掉的。 **一句话总结:低并发看响应,高并发看总量。** ## 来源 - 原帖(X/Twitter):https://x.com/AlicanKiraz0/status/2093801487784677884 - 作者 GitHub(TurboQuant MLX 移植等项目):https://github.com/alicankiraz1 ## 适合谁 - 纠结 Mac Studio / MBP M5 Max 买 64GB 还是 128GB 跑本地模型的人 - 想在 Mac 上挂本地 LLM 给多 agent / 批处理任务用的人 - 评估"27B 级模型在 Apple Silicon 上到底能不能当生产后端"的人 --- **分类**:硬件 **标签**:tok · 并发 · 请求 **作者**:子龙 **链接**:https://octohz.com/p/2083