GPU云服务器跑AI推理:算力怎么配、弹性扩容何时该做

2026-09-24 21:42 1003 次浏览

模型训练完只是第一步,把它稳定地跑起来对外提供服务,才是真正花钱和踩坑的地方。不少团队在本地机器上把推理跑通了,一上线就发现响应慢、并发一高就掉线,回头查配置才发现卡在了显存或者带宽上。这篇就围绕推理这个场景,把配置怎么选、什么时候该扩容讲清楚。

先看显存装不装得下,再看它跑得多快

判断一台机器能不能扛住你的推理任务,第一件事是算显存。模型权重占多少、KV Cache 占多少,加起来超过单卡容量就只能换卡或者上多卡。7B 模型用 FP16 推理大致要 14GB 显存,一张 RTX 4090 的 24GB 能装下还留有余量;换成 13B 或者 70B,24GB 就不够了,得考虑 A100 80GB 这类卡。

显存够了之后,决定响应速度的是内存带宽和算力。同样一张卡,batch size 调大吞吐会上去,但单次延迟也会涨,这里有个取舍。我一般建议先按真实请求量压一遍,别拿实验室的单条请求当基准。

散热是容易被忽略的一环。推理是长时间连续负载,风冷机箱压不住的话,卡跑到一定温度就降频,白天高峰时段的表现会明显差一截。

弹性扩容该在什么时候用

推理流量有明显的波峰波谷。白天请求多、夜里少,如果一直按峰值配机器,低谷时段就是在烧钱。弹性扩容的价值就在这里:平时用一张卡扛住基线流量,到了高峰再临时加实例。

  • 基线负载稳定、波动小于三成的,直接租固定配置更划算,弹性调度本身也有开销
  • 有明显早晚高峰、或者业务本身有活动周期的,弹性扩容能省下不少闲置成本
  • 对延迟敏感的在线服务,扩容要预留冷启动时间,临时拉起实例往往赶不上第一波流量

扩容这件事,我倾向于先租一个月观察真实负载曲线,再决定要不要上弹性。凭估算配出来的机器,多半不是买多了就是买少了。

多卡不是简单叠加,带宽才是瓶颈

单卡扛不住的时候,直觉是加卡。但多卡推理的性能提升,取决于卡之间怎么通信。模型并行要频繁交换中间结果,走 PCIe 和走 NVLink 的差距很大,双 A100 配 NVLink 和两张卡各自为战,跑同一个模型的吞吐能差出好几成。

还有一个现实问题:多卡机器的功耗和散热要求高得多,电源和机箱都得跟着换。双 A100 整机功耗轻松上到 1200W 以上,配电源得留足余量,用 1200W 金牌也只是刚够。这笔钱在规划预算时容易被漏掉。

所以我的判断是,能靠单卡加优化解决的,先别急着上多卡。量化、算子优化这些手段,很多时候能把单卡性能榨出不少空间,成本远低于加一张卡。

按什么标准挑机器

把上面几点收拢一下。小规模推理、模型在 7B 上下,一张 24GB 的卡加够用的内存和带宽就能起步,别一上来就堆多卡。并发上来了、单卡延迟压不住,再考虑升卡或者多卡并行。

选择服务商时,我更看重能不能按需调整配置、扩容是不是够快。有些场景下弹性比绝对性能更值钱——流量不确定的时候,能随时加减资源,比一开始就买顶配要省。德国法兰克福的 超大带宽高配置 VI 这类大带宽机型,适合对数据传输吞吐有要求的推理服务,E5-2683v4*2 配 128G 内存和 10G 带宽,月付 $2309.00,跑高并发请求时网络不会先成为瓶颈。

最后给个直接的结论:模型在 7B 以内、请求量平稳的,按单卡 24GB 起步就够,别为弹性付溢价;流量波峰明显的,选能快速扩容的方案;模型超过 13B 或者并发很高的,老老实实规划多卡和配套的电源散热,这部分钱省不得。