M5 Max 实测 Qwen3.8-27B MLX 4bit 并发扩展性:1→32 并行全数据

M5 Max 实测 Qwen3.8-27B MLX 4bit 并发扩展性:1→32 并行全数据


64GB 统一内存本地跑 27B,252 次请求零报错。低并发看响应,高并发看总量,甜蜜区在 N≤4

这是什么

土耳其工程师 Alican Kiraz(Trendyol 高级 Staff 工程师,常驻 MLX 开源社区)在 MacBook Pro(M5 Max,18 核 CPU / 40 核 GPU,64GB 统一内存) 上,用 Qwen3.8-27B MLX 4-bit 做了一组并发压测:1、2、4、8、16、32 个并行请求,两轮独立测试、每档 4 批、每请求固定 399 输出 token,252 次请求全部成功、零报错。

对想买 Mac Studio / MacBook Pro M5 Max(64GB 或 128GB)跑本地大模型的人来说,这是目前很少见的真实并发数据。

完整数据表

并发 N总吞吐 tok/s加速比效率单用户 tok/s批次耗时平均 TTFT最大 TTFT
131.961.00×100%29.6612.5 s0.38 s0.38 s
254.781.71×86%25.8214.6 s0.51 s0.63 s
474.792.34×58%17.7421.4 s0.74 s1.06 s
872.182.26×28%8.5044.5 s1.17 s1.97 s
1677.362.42×15%4.5882.6 s2.46 s5.43 s
32137.504.30×13%4.3092.9 s5.75 s12.81 s

TTFT = time to first token(首 token 延迟);Per User = 每个并发请求分到的速度。

三个结论

1、这套配置是稳的。 M5 Max 64GB 本地跑 27B 4-bit,252 次请求全成功零报错,MLX 量化 + continuous batching 在生产强度下没掉链子。

2、想要"打字就出字",并发控制在 1–4。 N=1 时单用户 29.7 tok/s、TTFT 0.38 秒,实时聊天体验最佳;N=4 时单用户仍有 17.7 tok/s,可接受。

3、想要"一口气处理很多请求",N=32 总吞吐最高(137.5 tok/s,4.3 倍)。 适合批处理、后台任务、agent 批量干活,不适合实时聊天——此时 TTFT 平均 5.75 秒、最差 12.8 秒,打字有明显等待感。

补充观察:甜蜜区其实在 N≤4

注意 N=8 的数据:总吞吐 72.18 tok/s 反而比 N=4(74.79)略低,效率却从 58% 暴跌到 28%。也就是说 N=4→8 之间存在一个拐点——再往上堆并发,本质是"拿效率换总量",N=32 的 137.5 tok/s 里有相当部分算力是被调度浪费掉的。

一句话总结:低并发看响应,高并发看总量。

来源

适合谁

  • 纠结 Mac Studio / MBP M5 Max 买 64GB 还是 128GB 跑本地模型的人
  • 想在 Mac 上挂本地 LLM 给多 agent / 批处理任务用的人
  • 评估"27B 级模型在 Apple Silicon 上到底能不能当生产后端"的人
10500举报0子龙•28天前
点击获取 ^_^
被收录:

暂无评论