GPU云服务器跑AI推理:算力怎么调、弹性怎么扩,钱花在哪一步
模型训完要上线,麻烦才刚开始。本地那台带RTX 4090的机器单跑demo没问题,接口一放出去、并发从个位数涨到几十,延迟就开始飘,显存占用也一路顶到24GB的红线。这时候要做的决定不是「再买张卡」这么简单——是继续加本地硬件,还是把推理搬到GPU云服务器上按需扩,两条路的钱和运维成本差得很远。这篇讲的是推理场景下算力怎么估、弹性怎么用、哪些钱其实可以省下来。
先算显存,再谈算力:模型装不下,卡再强也没用
判断一台机器够不够跑推理,第一步永远是显存能不能装下模型。
7B参数的模型用FP16精度加载,权重本身大致要占14GB;换成INT8量化能压到7GB上下,INT4再砍一半。这是纯权重的账,还没算KV Cache。上下文长度一拉长、并发数一上去,KV Cache能吃掉的显存可能比权重还多。所以一张24GB的卡跑7B FP16,单路对话够用,四路以上并发就要盯着显存曲线看了。
我一般会先按这个顺序估:
- 权重占多少:参数量 × 精度字节数,FP16按2字节算,INT8按1字节算
- KV Cache占多少:跟上下文长度和并发数成正比,长上下文场景要留出比权重更大的余量
装得下之后,才轮到算力。推理对算力的需求和训练完全不是一回事——训练吃的是持续满载的浮点吞吐,推理更看单次前向的延迟和显存带宽。显存带宽决定token生成速度,算力决定首token延迟。一台机器如果显存带宽跟不上,算力再高也是空转。
这也是为什么多卡方案在推理上不一定划算。双A100 80GB跑一个大模型,显存是够了,但要是模型本身能塞进单卡,多出来的那张卡大部分时间在等数据同步,利用率上不去,钱却照付。换我我会优先把模型量化到能塞进单卡,再考虑加卡。
弹性扩展值不值:按峰值买卡,还是按均值租卡
推理业务的负载曲线通常很陡。白天请求密、夜里几乎没人用,促销或者热点一来又瞬间翻几倍。按峰值配硬件,一年里大部分时间在浪费;按均值配,高峰直接打爆。
我见过不少这样的配置:为了扛住每天两小时的峰值,长期养着一台双卡机器,剩下二十二小时利用率不到两成。这笔账算下来,弹性扩展省的不是一点。
弹性扩展真正省钱的前提有两个,缺一个就不划算。
- 模型能快速冷启动:权重加载、显存初始化、推理框架预热,这一套如果超过几分钟,频繁扩缩容反而拖慢响应
- 请求可以拆分:多实例负载均衡做得好,新起的节点能立刻分担流量,而不是等它自己慢慢热起来
如果模型加载慢、又没法水平拆,那弹性扩容的收益会大打折扣。这种情况下按固定配置租一台、把单机吞吐压榨到极限,往往比反复扩缩容更稳。
还有一点容易被忽略:弹性扩出来的实例,网络和存储的带宽要跟得上。算力节点起来了,模型权重拉取慢、请求排队在网关,扩容等于没扩。选机器的时候,磁盘IO和出网带宽这两项别只看标称值。
钱花在哪:算力、带宽、还是那笔看不见的运维
GPU云服务器的报价,卡的型号往往只占一部分。真正拉开差距的是配套——机房线路、带宽计费方式、以及你为运维付的隐性成本。
拿具体的配置说。跑7B到13B这个量级的推理,单卡24GB显存是常见起点;要跑更大的模型或者高并发,就得看整机规格和显存上限。租用整机的好处是显存和内存不用跟别人抢,延迟稳定;代价是单价高、扩缩容没那么灵活。
带宽这块,推理服务的出网流量通常不大,但首包延迟和线路质量直接影响体验。国内用户访问海外机房,绕路和直连的延迟能差出一大截。我一般会先看线路是不是直连,再看带宽是不是独享——共享带宽在高峰期掉速,推理接口的响应时间会跟着抖。
存储和IO也别省。模型权重动辄十几GB,每次冷启动都要重新读盘,磁盘慢的话扩容时新节点迟迟进不了服务状态。这部分钱省下来,换回的是更长的扩容等待时间。
至于运维,托管型GPU云服务器省掉的是硬件故障排查、驱动版本管理、散热这些事。按我的经验,小团队自建推理机器的隐性成本,往往比表面上看到的硬件差价高。省下的运维人力能不能覆盖租金差价,这才是判断自建还是租用的关键。
收尾:按场景对号入座
把前面几条串起来,选型其实可以落到几个具体档位。
- 单模型、低并发、预算有限:优先选单卡24GB显存档,模型量化到INT8,把显存留给KV Cache,别急着上多卡
- 波动大、峰值明显:选支持弹性扩缩容的GPU云服务器,但要先验证模型冷启动时间和负载均衡能不能配合上
- 长上下文、高并发:显存带宽和总显存容量是硬指标,这时候多卡或者大显存整机的钱省不掉
价格上,推理型GPU实例的月付大致从几十美元的单卡档,到上千美元的多卡整机都有,差距主要在显存容量、卡数和线路质量。先租一个月看真实负载曲线,比任何估算都准。
如果你的业务对延迟和线路质量要求高,可以看看秀米云在新加坡和日本的整机方案,机房直连、带宽独享,适合把推理服务放在离用户更近的节点上。选之前把模型的显存占用和并发峰值算清楚,再对着配置单逐项核,基本不会买错。