GPU推理服务器怎么配才不浪费钱?算力、显存与弹性扩展的取舍
刚上线一个AI应用的人,多半会经历同一个阶段:本地用一张卡跑demo很顺,部署到线上就发现请求一多就排队。这时候最容易犯的错,是直接按「跑得动」的标准去买机器,而不是按「跑得稳」的标准。推理和训练是两件事,训练看的是算力峰值,推理看的是显存能不能装下模型、以及单位时间内能吐多少个token。这篇就把这几笔账拆开算,帮你判断钱该花在哪。
先算显存,再谈算力,顺序反了就是白花钱
判断一台机器够不够用,第一步是看显存能不能把模型装进去。7B模型用FP16推理,权重加KV Cache大致要14GB左右,一张RTX 4090 24GB能装下,还能留出并发余量。换成13B的FP16,显存需求跳到26GB上下,单张4090就不够了,要么上双卡,要么改用量化版本。
很多人一上来就盯着算力数字挑卡,结果买回来发现模型根本装不下,只能降精度或者砍上下文长度。这就是顺序错了。装得下是及格线,装得下之后才是算力决定吞吐。
- 7B FP16:约14GB,单张24GB卡可跑,并发数中等
- 13B FP16:约26GB,需要双卡或40GB以上单卡
- 7B INT8量化:约7~8GB,显存换速度,精度有损失
我一般会先问清楚模型规模和预期并发,再倒推卡的数量。不问这两点直接报配置,基本是瞎猜。
内存带宽决定它跑多快,散热决定它能跑多久
模型装得下之后,瓶颈会转移到内存带宽上。推理阶段每生成一个token都要把权重读一遍,所以显存带宽直接决定单卡吞吐。RTX 4090的显存带宽在1TB/s这个量级,A100 80GB是2TB/s左右,差距会体现在同样并发下的响应时间上。
另一个容易被忽略的是散热。数据中心里连续跑几小时不掉速,靠的是风道和机房温度控制,不是单看卡本身。消费级卡塞进机架式机箱,散热压不住就会降频,标称性能根本跑不满。这点我没法给你一个统一数字,不同机箱、不同机房差别很大,选之前最好确认散热方案。
所以看一台GPU推理服务器,我的判断顺序是:显存容量 → 显存带宽 → 散热与供电。三项里前两项是硬指标,第三项决定稳定性。
弹性扩展什么时候划算,什么时候是浪费
「弹性扩展」这个词听起来很美,但它的价值取决于你的负载曲线。如果白天请求多、夜里几乎为零,按需扩缩确实能省钱。如果负载全天平稳,弹性扩展带来的管理复杂度往往超过它省下的那点钱。
按我的经验,先租一个月看真实负载,比任何估算都准。跑出来的峰值并发、平均显存占用、每日请求分布,这几个数据拿到手,再决定是固定配置还是弹性方案。上来就按理论峰值配机器,多数情况下会闲置一半以上。
对于负载稳定的推理业务,固定配置的独立服务器往往更划算,没有虚拟化层的性能损耗,显存和带宽都是独占的。需要按量扩缩的场景,才考虑弹性方案。
如果你的业务需要一张稳定的推理卡长期在线,又不想被虚拟化层吃掉性能,可以看看洛杉矶裸机云服务器 VIII这类方案,E5-2680*2 / 32G / 100M,月付 $119.00,适合作为推理服务的前端或调度节点,把GPU资源留给真正吃算力的部分。
给不同规模业务的配置结论
单人开发或小团队内部使用,7B量化模型加一张24GB卡就够,重点是先把业务流程跑通,别急着堆硬件。中等规模、有稳定并发需求,优先考虑双卡或大显存单卡,保证高峰期不排队。大规模生产环境,再看多机多卡的调度和弹性扩展。
换我我会先租一个月试真实负载,再决定是加卡还是加带宽。钱花在显存和带宽上通常不亏,花在过剩的算力峰值上,大概率是浪费。