
这是什么
土耳其工程师 Alican Kiraz(Trendyol 高级 Staff 工程师,常驻 MLX 开源社区)在 MacBook Pro(M5 Max,18 核 CPU / 40 核 GPU,64GB 统一内存) 上,用 Qwen3.8-27B MLX 4-bit 做了一组并发压测:1、2、4、8、16、32 个并行请求,两轮独立测试、每档 4 批、每请求固定 399 输出 token,252 次请求全部成功、零报错。
对想买 Mac Studio / MacBook Pro M5 Max(64GB 或 128GB)跑本地大模型的人来说,这是目前很少见的真实并发数据。
完整数据表
| 并发 N | 总吞吐 tok/s | 加速比 | 效率 | 单用户 tok/s | 批次耗时 | 平均 TTFT | 最大 TTFT |
|---|---|---|---|---|---|---|---|
| 1 | 31.96 | 1.00× | 100% | 29.66 | 12.5 s | 0.38 s | 0.38 s |
| 2 | 54.78 | 1.71× | 86% | 25.82 | 14.6 s | 0.51 s | 0.63 s |
| 4 | 74.79 | 2.34× | 58% | 17.74 | 21.4 s | 0.74 s | 1.06 s |
| 8 | 72.18 | 2.26× | 28% | 8.50 | 44.5 s | 1.17 s | 1.97 s |
| 16 | 77.36 | 2.42× | 15% | 4.58 | 82.6 s | 2.46 s | 5.43 s |
| 32 | 137.50 | 4.30× | 13% | 4.30 | 92.9 s | 5.75 s | 12.81 s |
TTFT = time to first token(首 token 延迟);Per User = 每个并发请求分到的速度。
三个结论
1、这套配置是稳的。 M5 Max 64GB 本地跑 27B 4-bit,252 次请求全成功零报错,MLX 量化 + continuous batching 在生产强度下没掉链子。
2、想要"打字就出字",并发控制在 1–4。 N=1 时单用户 29.7 tok/s、TTFT 0.38 秒,实时聊天体验最佳;N=4 时单用户仍有 17.7 tok/s,可接受。
3、想要"一口气处理很多请求",N=32 总吞吐最高(137.5 tok/s,4.3 倍)。 适合批处理、后台任务、agent 批量干活,不适合实时聊天——此时 TTFT 平均 5.75 秒、最差 12.8 秒,打字有明显等待感。
补充观察:甜蜜区其实在 N≤4
注意 N=8 的数据:总吞吐 72.18 tok/s 反而比 N=4(74.79)略低,效率却从 58% 暴跌到 28%。也就是说 N=4→8 之间存在一个拐点——再往上堆并发,本质是"拿效率换总量",N=32 的 137.5 tok/s 里有相当部分算力是被调度浪费掉的。
一句话总结:低并发看响应,高并发看总量。
来源
- 原帖(X/Twitter):https://x.com/AlicanKiraz0/status/2093801487784677884
- 作者 GitHub(TurboQuant MLX 移植等项目):https://github.com/alicankiraz1
适合谁
- 纠结 Mac Studio / MBP M5 Max 买 64GB 还是 128GB 跑本地模型的人
- 想在 Mac 上挂本地 LLM 给多 agent / 批处理任务用的人
- 评估"27B 级模型在 Apple Silicon 上到底能不能当生产后端"的人
暂无评论
