GPU云服务器跑AI推理,别被"弹性扩展"四个字带偏

2026-10-11 14:40 1012 次浏览

做AI推理的人大多经历过这个阶段:本地一张卡跑demo挺顺,一接入真实请求就开始卡。并发从1涨到5,响应时间翻三倍;模型从7B换到13B,显存直接爆。这时候你开始搜"GPU云服务器",页面上全是同一句话——深度优化推理算力、弹性扩展。听起来什么都能干,实际下单的时候还是不知道选哪档配置。

问题不在云厂商,在于推理这件事本身没有统一答案。同样是跑模型,有人只服务自己一个人,有人要扛住几百个并发;有人跑7B的对话模型,有人跑Stable Diffusion出图。需求差一个量级,配置就差一个量级。下面按我自己的判断顺序,把这件事拆开讲。

先算显存,装不下模型其他都免谈

选推理卡的第一件事是算显存,不是看算力。模型参数量乘以精度对应的字节数,大致就是权重占用的显存。7B模型用FP16推理,权重约14GB;用INT8量化能压到7GB上下;4bit量化大约4GB。这是权重部分,实际还要留出KV Cache和中间激活的空间,通常再加20%~40%的余量。

所以一张24GB显存的RTX 4090,跑7B FP16是舒服的,跑13B FP16就悬了。13B FP16权重约26GB,4090装不下,得换A100 40GB或者双卡。如果做4bit量化,13B大约7GB,4090绰绰有余,还能留出并发空间。这就是量化为什么在推理场景这么重要——它直接决定了你要花多少钱买卡。

按我的经验,单人自用或者内测阶段,24GB显存能覆盖绝大多数7B~13B量化模型。真正需要往上加的,是并发数上来了之后。

显存够用之后,瓶颈往往在别的地方

很多人配完卡发现速度还是不理想,就以为是GPU不行。实际跑一下nvidia-smi看利用率,GPU可能只跑到40%,剩下的时间都在等数据。推理的瓶颈经常不在算力,而在数据搬运。

  • 内存带宽:模型权重从内存加载到显存的速度,决定了首token延迟。DDR4和DDR5在这项上差距明显,双通道和单通道差距更大。
  • CPU核数与PCIe通道:多并发请求调度、前后处理、tokenize都在CPU上跑。核数太少,GPU会空转等活干。

这也是为什么GPU云服务器和自攒机在推理场景体验不一样。云厂商的宿主机通常配了足够的内存带宽和PCIe通道,自己攒机如果主板和CPU选得随意,很容易在这两项上吃亏。我一般会先确认内存是不是双通道起、PCIe是不是x16,再看GPU型号。

什么时候该租,什么时候该买

这是最实际的取舍。GPU云服务器按小时或按月计费,好处是随时换配置、不用管硬件故障、弹性扩缩。代价是长期跑下来单价高,而且你租的是共享宿主机的资源,邻居跑满的时候性能会有波动。

自攒机一次性投入大,但连续跑一年以上的话,单位算力成本通常更低。麻烦在于选型、散热、故障排查都得自己来,卡和主板不匹配要整套换,电源带不动双卡又得加钱。

我的判断标准很简单:业务还没验证、负载波动大、需要快速试不同模型,先租。负载稳定、连续跑半年以上、对数据不出机房有要求,可以考虑自建或者租物理服务器。像香港物理服务器 V这类独享整机的方案,在推理场景里比共享型云主机更可控,E5-2680V2双路、32G内存、10M带宽,适合中小规模推理服务长期跑。

如果并发量真的上来了,需要大内存和大带宽支撑多路推理请求,香港宿主机(大母鸡)⑦这种金牌6152双路、512G内存、30M带宽的配置,能同时挂多张卡、多路并发,月付5500元这个价位在独享整机里算合理。

弹性扩展不是免费的,先看扩展的粒度

"弹性扩展"这个词容易让人以为加钱就能无限加算力。实际扩展有粒度问题:你扩的是GPU实例、还是整个宿主机?扩的时候模型要不要重新加载?KV Cache能不能迁移?

推理服务扩容最怕的是冷启动。新实例起来要重新加载模型权重,13B模型从磁盘读到显存可能要几十秒,这段时间请求全堆在旧实例上。所以真正好用的弹性扩展,前提是模型加载快、或者有预热机制。选型的时候可以问清楚:扩容实例的启动时间大概多少、有没有模型缓存。

另一个容易忽略的点是显存碎片。长时间跑推理,显存会逐渐碎片化,可用显存越来越少,最后OOM。这时候重启实例能缓解,但治本要靠推理框架的显存管理策略。这部分我没实测过所有框架,不同版本表现可能不一样。

结论给得直接一点:单人自用或内测,24GB显存的实例足够,月付几百元档位就能起步;中小规模并发(几十路以内),选独享物理服务器比共享云主机稳,预算大致在月付两三百到几千元区间;真要做大规模推理集群,先租一个月看真实负载曲线,比任何估算都准。别一上来就按峰值配,推理的负载曲线通常比你想的平缓。