AI推理服务器怎么配才不浪费钱?GPU、显存与弹性的实战取舍
做AI推理的团队大多会卡在同一个地方:模型在本地跑demo挺顺,一上生产就发现要么显存爆了,要么并发一上来延迟翻倍,要么账单比预期高出好几倍。问题通常不在模型本身,而在机器配置和扩展方式没跟业务量对齐。下面按「先算清需要什么、再决定怎么扩」的顺序拆开讲,重点放在推理而不是训练上,因为推理才是长期吃钱的那部分。
先算模型要多少显存,再谈买什么卡
推理和训练对硬件的要求不一样。训练要的是大显存加高带宽,推理更看单卡能不能把模型装下、以及单位时间的吞吐。
7B参数模型用FP16精度推理,权重本身大约占14GB显存,加上KV Cache和框架开销,实际要留到16GB以上。RTX 4090有24GB,单卡跑7B没什么压力。13B的FP16就要26GB左右,4090就装不下了,得上双卡或者换A100 40GB。70B级别基本是A100 80GB起步,或者多卡张量并行。
量化能明显降低门槛。INT8量化后7B大约7GB,INT4能压到4GB上下,代价是精度有损失,具体掉多少得看你自己的任务。
我的判断是:单人用或者低并发,24GB显存的卡足够;多人并发或者要跑13B以上,直接按显存需求往上选,别指望靠优化硬塞。省下的卡钱最后会变成延迟和重试的成本。
显存装得下之后,卡你的是带宽和散热
显存够用只是及格线。模型装得进去,接下来决定它跑多快的是内存带宽,决定它能连续跑多久的是散热。
A100的HBM2带宽约1.5TB/s,4090的GDDR6X约1TB/s,纸面差距不算夸张,但在多卡并行和长上下文场景里,带宽会直接反映到首token延迟上。散热更容易被忽略:消费级卡在机箱里长时间满负载,温度压不住就会降频,吞吐掉下来你还找不到原因。
这几项按优先级排:
- 显存容量决定能不能跑,这是硬门槛,不够就是不够
- 显存带宽决定跑多快,影响延迟和并发上限
- 散热和供电决定能不能稳定跑,影响长期可用性
很多人把预算全砸在卡上,电源和散热凑合,结果机器跑几小时就降频,等于白买。1200W金牌电源带单张4090是够的,双卡就得往上加。
弹性扩展:什么时候租比买划算
这是整个推理部署里最值得算清楚的一步,也是最容易花冤枉钱的地方。
自建机器前期投入大,一张A100 80GB单卡价格就不低,配齐整机更贵,而且买回来利用率不一定高。推理负载通常有明显的波峰波谷,白天忙晚上闲,工作日忙周末闲,固定配置意味着大量时间在空转。
按我的经验,负载波动超过三成的场景,弹性租用比自建更划算。你按峰值配机器,低谷期就是浪费;按均值配,峰值来了又扛不住。租用可以按需扩缩,把峰值时段临时加上去,低谷释放掉。
但弹性不是万能。如果你的负载很平稳、长期跑满,自建的单位成本反而低。判断标准很简单:机器利用率能不能长期维持在七成以上。能,就买;不能,就租。
换我我会先租一个月,把真实并发和GPU利用率摸清楚,再决定要不要自建。这比任何估算都准。
如果推理服务要对外提供低延迟访问,机器放在哪也很关键。面向亚太用户,香港自营物理服务器这类独立服务器在延迟和带宽上更可控;面向欧美用户则要考虑美国节点。推理服务的响应时间对用户体验影响直接,机房位置选错,网络延迟会把算力优势抵消掉。
把成本花在刀刃上
推理部署的取舍其实就三件事:显存按模型大小配,别省;带宽和散热决定稳定性,别凑合;扩展方式按负载波动选,别一刀切。
具体到配置,7B模型单卡24GB能起步,13B以上准备40GB或80GB显存,多并发场景优先看HBM带宽。负载平稳长期跑满就自建,波动大的就租用弹性扩缩。不确定的时候先租一个月测真实利用率,这个钱花得值。
真正烧钱的地方不在买贵了,而在配错了之后的返工和长期空转。