AI推理服务器怎么配:显存、带宽与散热的三笔账

2026-10-03 07:38 1009 次浏览

打算自建推理服务的人,多数会先问一张卡够不够,然后才发现真正卡壳的地方不在卡本身。模型装不下、并发一上来就掉速、跑两小时风扇狂转降频,这三件事往往同时出现。判断一台机器能不能扛住你的业务,得先把显存、内存带宽和散热分开算账,混在一起谈只会越谈越乱。下面按我实际选型时的顺序拆开说。

先算显存:模型装不装得下,决定要不要上第二张卡

显存是第一道门槛,装不下就直接出局。以 FP16 推理为例,参数每 10 亿大约占 2GB,7B 模型差不多要 14GB,加上 KV Cache 和框架开销,实际按 16GB 到 18GB 估更稳妥。RTX 4090 的 24GB 能放下,但留给并发的余量不多。

量化能省显存。INT8 大致砍一半,INT4 再砍一半,代价是精度损失,客服问答这类任务通常感知不明显,代码生成和数学推理就要小心。按我的经验,先确定精度,再确定卡数,顺序反了会白花钱。

  • 7B FP16:约 14GB,单张 24GB 卡可跑,并发 4 到 8 路
  • 13B FP16:约 26GB,单卡 24GB 装不下,需要两张或换 48GB 卡
  • 70B INT4:约 35GB,双卡 24GB 或单张 A100 40GB 起步

这里有个取舍:加一张 4090 大约多花一万多,换成双 A100 40GB 整机价格翻好几倍。如果只是内部工具、日请求量几百次,加卡是更划算的那条路。

再看内存带宽:它决定的是速度,不是能不能跑

显存够用之后,瓶颈就转移到带宽上。推理每生成一个 token,都要把模型权重从显存读一遍,所以理论速度基本由显存带宽除以模型大小决定。RTX 4090 的带宽约 1008GB/s,跑 7B FP16 理论上限大致在每秒 70 token 上下,实际受框架和 batch 影响会低一些。

A100 80GB 的带宽约 2039GB/s,是 4090 的两倍,但价格差得更远。这里我一般会先问一句:你的业务是延迟敏感还是吞吐敏感?对话类应用对单次响应速度要求高,带宽值钱;批量离线任务更看总吞吐,多张消费卡堆起来的性价比反而更好。

系统内存也不能太抠。权重加载、KV Cache 换出、数据预处理都吃内存,64GB 是推理机比较舒服的起点,32GB 在加载大模型时容易触发 swap,速度会断崖式下跌。

散热与整机:连续跑几小时不掉速才算过关

消费卡塞进 4U 机箱做长时间推理,散热是最容易被低估的一环。4090 单卡功耗 450W,双卡就是 900W,加上 CPU 和主板,1200W 金牌电源是底线,机箱风道不好还会触发温度墙降频。

按我的经验,实验室里跑几分钟的测试说明不了问题,连续压测四小时以上、观察 token/s 是否随时间下滑,才算摸到真实表现。数据中心用的涡轮卡噪音大但风道稳定,家用卡改水冷则要额外算维护成本。

如果不想自己折腾散热和供电,直接租用整机是更省事的选择。硅谷机房的 硅谷裸机云 XI 配 E5-2680v4*2 加 64G 内存、100M 带宽,月付 $139,适合把推理服务放在境外、又不想承担整机采购风险的场景。真要上多卡训练或高并发推理,美国硅谷高防服务器 XXXVI 的 E5 2698v4*2 平台在扩展位和供电余量上更从容,月付 $329。

收尾:按并发数倒推配置,比按模型大小正推更准

选型最容易犯的错是先看模型多大再挑卡,结果并发一上来就不够用。反过来算更实用:先估峰值并发,再乘单路显存和带宽需求。

  • 日请求几百次、并发个位数:单张 24GB 卡加 64G 内存,月成本控制在两千元以内
  • 并发几十路、要求稳定响应:双卡或 A100 级别,预算按整机几万元准备
  • 批量离线、对延迟不敏感:多张消费卡堆吞吐,比买一张旗舰卡划算

拿不准的时候,先租一个月跑真实负载,比任何估算都准。真到了要长期扩容,再考虑自购整机。