跑 AI 模型,机器怎么配?从五千到两万以上的三档配置方案
被问得最多的一句话是:「我就想跑个模型,机器到底怎么配?」这问题没有标准答案,但踩坑的地方高度集中:钱大多花在了不该花的地方,该省的又没省。下面分两条线讲——硬件怎么挑、软件怎么搭,最后给三档能直接照抄的配置。
硬件选型:显卡之外,还有四样东西会让你翻车
先说显卡。选卡时别只盯核心数,显存才是决定跑不跑得起来的那条线。预算五千以内,二手 GTX 1080 或 RTX 3060 是常见起点,8GB 显存够跑 10B 以下的小模型,简单的图像分类也不在话下;买二手尽量挑带金属背板的型号,长时间高负载下 PCB 容易变形。
预算拉到五千到两万,RTX 4090 的 24GB 显存是分水岭。这个容量能躲掉大多数模型的 OOM 报错,跑 Llama 3-13B 推理大概 20-40 Token/s,Stable Diffusion XL 出图也顺畅。有个细节容易漏:训练时要留出大约 30% 显存给中间变量,否则「看着够用」的显存跑到一半照样爆。
两万以上就进多卡区间了。双 A100 或 H100 配 NVLink 互联,卡间带宽能到 900GB/s 以上,显存池化之后,千亿级模型的微调才撑得住。
第二个坑是 CPU。低功耗移动版本别碰,TDP 一限制,多线程性能基本腰斩。入门拿 Ryzen 5 7600X 或 i5-13400F 做数据预处理就够;中高端可以上 Ryzen 9 7950X3D 或 Xeon Gold 6438,大缓存对模型权重加载帮助明显,PCIe 5.0 也让 GPU 和存储之间的吞吐翻倍。如果你打算以后加卡,选主板时就把 PCIe 通道拆分考虑进去,不然到时候只能整套换掉。
内存和存储的原则是「先够用,再留一个升级口」。内存起步 32GB DDR5,频率 5600MT/s 以上、时序 CL36 以内;要跑大模型全量微调,或者同时开多个任务,建议直接上 64GB 到 128GB 的 DDR5 ECC。存储方面,系统盘 1TB NVMe,训练集用两块 2TB NVMe 组 RAID 0,日志和备份再挂一块 4TB HDD。更稳妥的做法是系统盘做 RAID 1、数据盘做 RAID 5/6,单盘挂了训练也不至于从头再来。
网络和散热总被放到最后考虑,它们才是真正的隐形门槛。分布式训练至少双万兆网卡配 RDMA,规模再往上走就是 400G InfiniBand。散热可以算个账:双 GPU 加高功耗 CPU,整机功耗可能接近 1000W,360mm 水冷是底线,八卡以上集群就得考虑冷板式液冷。电源按单 GPU 450W 预留,双卡建议 1200W 金牌,冗余留 30%。
不想在硬件兼容性和散热风道上耗时间的话,直接租独立物理服务器省心得多。像 韩国独立物理服务器 这类 Xeon Gold 6138 配 32G DDR4 的机型,拿来跑 AI 推理和中小规模训练刚好;预算宽裕、要上更大模型,可以看 首尔服务器8,双路 EPYC 7542 加 128G 内存,多任务并行会从容很多。
软件环境:系统、驱动、框架,顺序别乱
系统首选 Ubuntu 22.04 LTS,主流 AI 框架的原生支持最好,遇到问题也最容易搜到答案。驱动可以 apt 装,也可以去官网下 .run 手动装,两种都行;关键是 CUDA 版本要和 GPU 架构对上号,Ada Lovelace 至少 CUDA 12.0 起步,cuDNN 建议 8.9 以上。装完先跑 nvidia-smi 和 nvcc --version 核对版本,别等出错了才回头查。
框架上,PyTorch 是首选,动态图调试方便,适合快速迭代;TensorFlow 的优势在生产部署和量化。模型直接去 Hugging Face 拿,Transformers 和 Stable Diffusion WebUI 这两个库基本够用。依赖管理强烈建议用 Miniconda 建隔离环境,或者用 Docker 把环境打包成镜像,换服务器迁移的时候能省掉一堆重装依赖的麻烦。
推理加速是很多人会跳过的一步,性价比却很高:TensorRT 能把 PyTorch 模型转成 FP16 或 INT8,速度提升 3-5 倍;ONNX Runtime 跨平台支持更好,适合边缘设备。要把模型变成服务,可以用 Triton Inference Server 做多模型并行,也可以自己用 FastAPI 写接口,把预处理和后处理串起来。
三档实战配置,按预算直接抄
个人学习档(预算五千内):Ryzen 5 7600X 加二手 GTX 1080 或 RTX 3060,32GB DDR5,1TB NVMe 加 4TB HDD。Llama 2-7B、T5-3B 能跑,推理速度 5-10 Token/s,Stable Diffusion XL 基础版单张出图 15-20 秒。PCIe 插槽留出来,以后换显卡不用换主板;内存加到 64GB 就能玩 LoRA 微调。
家庭实验室档(预算 1-2 万):i7-14700K 加 RTX 4090,64GB DDR5-6000,2TB NVMe 系统盘加 8TB 数据盘,双万兆网卡,360mm 水冷。Llama 3-13B 和 ChatGLM4 做多轮对话没问题,Stable Diffusion XL 配 ControlNet 能做精确的图像控制,PyTorch DDP 也跑得动双卡数据并行。想省钱的话,CPU 选散片或非 K 后缀型号能省出几百块。
企业科研档(预算两万以上):双路 EPYC 9654 加 2×H100 80GB,128GB DDR5 ECC 可扩展到 2TB,8TB NVMe RAID 0 加 30TB HDD,400G InfiniBand 网卡,冷板式液冷。70B 以上参数模型的全量训练、万亿级 Token 数据集都撑得住,配合 Kafka 还能做实时视频分析和多语言翻译。如果自建集群太重,也可以从 首尔服务器9 这类双路 EPYC 7742、256G 内存的独立服务器起步,算力按需往上加。
绕了一圈回头看,配置这事确实没有标准答案,但有一个顺序:先把显存这条线定下来,再看内存带宽和散热跟不跟得上,最后才拿预算去填。顺序对了,钱基本不会白花。