# 本地跑顶级大模型完整攻略(2千到4万美元硬件方案) > 想自己组装机器在本地跑顶级AI大模型,不依赖任何API?这份攻略从硬件选型到系统配置到模型推荐全讲清楚了,2千美元起步。 ## Everything I Know About Running SOTA LLMs Locally 作者花了约 5 万美元组装了一台 4×RTX Pro 6000(384GB VRAM)的本地推理机器,然后把所有硬件选型、组装踩坑、系统配置、模型推荐整理成了这份完整攻略。 ### 适合谁看 想脱离 API 依赖、在本地跑顶级大模型的人。无论预算是 2 千还是 4 万,这份指南都有对应方案。 ### 两个价位方案 | 预算 | 配置 | VRAM | 能跑的模型 | |------|------|------|-----------| | ~$2,000 | 2×RTX 3090 | 48GB | Qwen3.6-27B、whisper-large-v3 | | ~$40,000 | 4×RTX 6000 Pro | 384GB | GLM-5.2-594B(接近 Claude Opus) | ### 核心内容 **🖥️ 硬件选型完整 BOM** - 主板(ASRock Rack ROMED8-2T)、CPU(EPYC Milan)、内存、电源、散热 - 作者策略:把钱花在 VRAM 上而非 PCIe5/DDR5,主板和 CPU 全从 eBay 淘 - GPU 机箱和 PCIe Switch 的木质外罩自制方案 **⚡ PCIe Switch 加速张量并行** - 使用 c-payne 的 Microchip Switchtec PM40100 Gen4 PCIe Switch - 让 GPU 之间直接通信,绕过 CPU root complex - 详细的 BIOS 配置(PCIe 分叉、ASPM、Re-Size BAR、SR-IOV) - 内核参数(iommu=off、ACS Disable)和 NCCL P2P 配置 **🧠 模型推荐(按月更新)** - 当前推荐:GLM-5.2-Int8Mix-NVFP4-REAP-594B - 附带对应的 runner 配置文件 - 模型量化方案(NVFP4、Int8Mix、REAP) **🔧 底层配置踩坑** - ACS Enable/Disable 对 P2P 通信的影响 - NVLink带宽测试与调优 - PCIe 降速问题的排查思路 ### 作者的其他项目 - [stt](https://github.com/jamesob/stt) — 跨平台语音转文字工具 ### 许可证 MIT 开源 --- **分类**:教程 **标签**:方案 · 模型 · PCIe **作者**:Xiao.Xi **链接**:https://octohz.com/p/1892