GPU推理服务器怎么配才不浪费钱?算力选型与弹性扩容的实战判断

2026-10-10 20:44 1007 次浏览

做AI推理的团队,最常卡住的地方往往不是模型调不出来,而是机器买回来之后发现跑得没那么快,或者并发一上来就排队。一个7B模型用FP16加载,权重本身就占掉大约14GB显存,还没算KV Cache和框架开销。很多人先看显卡型号,看到RTX 4090 24GB就觉得够,结果部署完发现并发一高就OOM。这篇按真实业务量往下拆,先讲清楚钱该花在哪,再讲什么时候该扩。

先算显存,再谈算力

判断一台GPU服务器够不够,顺序不能反。第一步是看显存能不能把你手上的模型装进去,这一步过不了,后面的算力都是空谈。7B模型FP16大约14GB,量化到INT8能压到7GB上下,INT4还能再砍一半。13B的FP16就接近26GB,单张24GB的卡直接放不下,要么量化,要么上两张卡做张量并行。

显存够了之后,才轮到算力。同样的模型,RTX 4090和A100跑单条请求的延迟差距,多数情况下没有价格差距那么大。真正拉开差距的是并发:A100的显存带宽大致是4090的两倍左右,同时处理几十路请求时,吞吐量差距会明显放大。我的判断是,日请求量在几万次以内、并发个位数,单张4090 24GB足够;真到几十路并发,再考虑A100或者双卡。

按QPS选卡,还是按模型选卡

这两种思路对应两种业务。按模型选卡,适合模型固定、请求量波动不大的场景,比如内部知识库问答或者固定的文档处理流水线。你只要保证显存装得下、单次延迟能接受,剩下的钱可以省下来。

按QPS选卡,适合对外提供服务的场景。这时候要算的是峰值每秒查询数,再倒推需要多少张卡。一个粗略的估算方式是:单张4090跑7B INT8模型,单路生成速度大致在每秒几十个token,如果每个请求平均要生成200个token,那单卡每秒大概能扛零点几路到一路的并发。这个数字不同框架、不同批次大小差别很大,我没法给你一个绝对数,只能按自己的实测曲线去推。

省钱的思路在这里:与其一步到位买四张卡,不如先把单卡跑满,看真实峰值再扩。多花的钱如果换不来对应的QPS,就是闲置成本。

弹性扩展什么时候值得多花钱

弹性扩容的价值不在平时,在峰值。白天请求量是夜间的三到五倍很常见,如果按峰值配机器,夜间就是纯浪费;如果按均值配,白天就得排队。

这种情况我一般建议两条路:

  • 业务有明显波峰波谷的,用能按量扩缩的算力,峰值过去就释放,代价是单价通常比包月高;
  • 请求量平稳、只是偶尔小涨的,直接租物理GPU服务器更划算,月付固定,不用担心被按量计费反噬。

还要看数据在哪。如果模型权重和数据集都在本地,频繁扩缩容带来的镜像拉取和权重加载时间会吃掉弹性带来的收益。一个几十GB的模型,冷启动加载就要几分钟,这段时间的实例是空转的。

租物理机还是租按量算力

长期跑推理,物理服务器的单位算力成本通常更低,而且独占资源,不会被邻居影响。秀米云这边如果业务本身跑在海外节点上,可以考虑美国洛杉矶高防服务器42,Gold-6133*2 / 64G / 100M 的配置月付 769.00 美元,适合把推理服务放在离用户近的机房里;预算更紧的话,美国洛杉矶高防服务器24用 E5 2683V4*2 / 64G / 100M,月付 279.00 美元,作为推理前端或者调度节点够用。

但要注意,这类机器本身不带GPU,GPU卡需要单独配或者选带卡的方案,下单前先确认机房能不能装你要的卡型。

什么时候别选物理机?业务还在验证阶段、请求量一天一个样的时候。这时候按月付锁一台机器,很可能第二个月就发现配置不对。先按量跑一个月,把QPS曲线和显存占用摸清楚,再决定买什么。

总结成一句可执行的:模型固定、并发个位数,单张4090 24GB起步;并发上到几十路、延迟要求严格,往A100或者双卡走;波峰波谷明显就上弹性,平稳就租物理机。先把单卡压满再扩,是最不容易花冤枉钱的做法。