本地跑顶级大模型完整攻略(2千到4万美元硬件方案)

本地跑顶级大模型完整攻略(2千到4万美元硬件方案)


想自己组装机器在本地跑顶级AI大模型,不依赖任何API?这份攻略从硬件选型到系统配置到模型推荐全讲清楚了,2千美元起步。

Everything I Know About Running SOTA LLMs Locally

作者花了约 5 万美元组装了一台 4×RTX Pro 6000(384GB VRAM)的本地推理机器,然后把所有硬件选型、组装踩坑、系统配置、模型推荐整理成了这份完整攻略。

适合谁看

想脱离 API 依赖、在本地跑顶级大模型的人。无论预算是 2 千还是 4 万,这份指南都有对应方案。

两个价位方案

预算配置VRAM能跑的模型
~$2,0002×RTX 309048GBQwen3.6-27B、whisper-large-v3
~$40,0004×RTX 6000 Pro384GBGLM-5.2-594B(接近 Claude Opus)

核心内容

🖥️ 硬件选型完整 BOM

  • 主板(ASRock Rack ROMED8-2T)、CPU(EPYC Milan)、内存、电源、散热
  • 作者策略:把钱花在 VRAM 上而非 PCIe5/DDR5,主板和 CPU 全从 eBay 淘
  • GPU 机箱和 PCIe Switch 的木质外罩自制方案

⚡ PCIe Switch 加速张量并行

  • 使用 c-payne 的 Microchip Switchtec PM40100 Gen4 PCIe Switch
  • 让 GPU 之间直接通信,绕过 CPU root complex
  • 详细的 BIOS 配置(PCIe 分叉、ASPM、Re-Size BAR、SR-IOV)
  • 内核参数(iommu=off、ACS Disable)和 NCCL P2P 配置

🧠 模型推荐(按月更新)

  • 当前推荐:GLM-5.2-Int8Mix-NVFP4-REAP-594B
  • 附带对应的 runner 配置文件
  • 模型量化方案(NVFP4、Int8Mix、REAP)

🔧 底层配置踩坑

  • ACS Enable/Disable 对 P2P 通信的影响
  • NVLink带宽测试与调优
  • PCIe 降速问题的排查思路

作者的其他项目

  • stt — 跨平台语音转文字工具

许可证

MIT 开源

2100举报0Xiao.Xi1个月前
点击获取 ^_^
被收录:

暂无评论