
想自己组装机器在本地跑顶级AI大模型,不依赖任何API?这份攻略从硬件选型到系统配置到模型推荐全讲清楚了,2千美元起步。
Everything I Know About Running SOTA LLMs Locally
作者花了约 5 万美元组装了一台 4×RTX Pro 6000(384GB VRAM)的本地推理机器,然后把所有硬件选型、组装踩坑、系统配置、模型推荐整理成了这份完整攻略。
适合谁看
想脱离 API 依赖、在本地跑顶级大模型的人。无论预算是 2 千还是 4 万,这份指南都有对应方案。
两个价位方案
| 预算 | 配置 | VRAM | 能跑的模型 |
|---|---|---|---|
| ~$2,000 | 2×RTX 3090 | 48GB | Qwen3.6-27B、whisper-large-v3 |
| ~$40,000 | 4×RTX 6000 Pro | 384GB | GLM-5.2-594B(接近 Claude Opus) |
核心内容
🖥️ 硬件选型完整 BOM
- 主板(ASRock Rack ROMED8-2T)、CPU(EPYC Milan)、内存、电源、散热
- 作者策略:把钱花在 VRAM 上而非 PCIe5/DDR5,主板和 CPU 全从 eBay 淘
- GPU 机箱和 PCIe Switch 的木质外罩自制方案
⚡ PCIe Switch 加速张量并行
- 使用 c-payne 的 Microchip Switchtec PM40100 Gen4 PCIe Switch
- 让 GPU 之间直接通信,绕过 CPU root complex
- 详细的 BIOS 配置(PCIe 分叉、ASPM、Re-Size BAR、SR-IOV)
- 内核参数(iommu=off、ACS Disable)和 NCCL P2P 配置
🧠 模型推荐(按月更新)
- 当前推荐:GLM-5.2-Int8Mix-NVFP4-REAP-594B
- 附带对应的 runner 配置文件
- 模型量化方案(NVFP4、Int8Mix、REAP)
🔧 底层配置踩坑
- ACS Enable/Disable 对 P2P 通信的影响
- NVLink带宽测试与调优
- PCIe 降速问题的排查思路
作者的其他项目
- stt — 跨平台语音转文字工具
许可证
MIT 开源
暂无评论
