推理成本压不下来?聊聊GPU服务器怎么按真实负载配

2026-09-29 14:38 1002 次浏览

做推理服务的人多半遇到过这种局面:模型本地能跑,一上线上并发就卡,于是第一反应是加卡。加完卡账单翻倍,QPS却没涨多少。问题往往不在卡的数量,而在你选的卡装不装得下模型、显存带宽够不够喂满计算单元。

这篇讲的是推理这条线上,怎么从真实负载倒推配置,而不是先看价格表再想业务。

先算显存,别先看卡的价格

判断一台机器能不能跑你要的模型,第一步是显存容量。7B 参数模型用 FP16 推理,光权重就占大约 14GB,加上 KV Cache 和框架开销,24GB 的 RTX 4090 单卡刚好够一个人用。要跑 13B,FP16 下权重接近 26GB,单张 24GB 卡就装不下了。

装不下就得换思路:要么量化到 INT8,显存大致砍半,7B 落到 7GB 左右;要么上双卡做张量并行。量化会掉一点精度,多数对话类业务感知不明显,我一般建议先量化试,不够再谈加卡。

显存够用之后,决定速度的是显存带宽。4090 的带宽在 1TB/s 量级,A100 80GB 是 2TB/s 上下,同样跑 7B,后者的 token 吞吐通常能翻一倍多。所以别只看卡数,带宽差一档,同样的钱买到的并发能力差很多。

按并发量倒推,而不是按峰值买

显存算完只是下限。真正决定要几张卡的,是你的并发请求数。单人对话和 50 人同时在线,对显存和算力的需求完全不是一个量级。

  • 低并发(个位数同时在线):单张 24GB 卡跑量化后的 7B 基本够,重点是延迟稳定。
  • 中等并发(几十路):考虑 A100 40GB 或 80GB,或者两张消费卡做并行,KV Cache 是主要吃显存的部分。
  • 高并发(上百路):单机很难扛,得走多机加负载均衡,这时候弹性扩展才有意义。

我见过不少配置是照峰值买的,双 A100 常年跑在 20% 利用率。多花的那部分钱,够租三个月按量实例做灰度测试了。先按日常负载配,峰值用弹性扩上去,这是更划算的路径。

弹性扩展什么时候真省钱

弹性扩的价值在负载有波峰波谷。白天请求多、夜里几乎没人,这种业务按量付费明显比包月划算。反过来,负载平稳、7×24 都在跑的推理服务,包月独立服务器摊下来单价更低,也更可控。

关键在于你多久扩容一次。一天扩几次、每次几分钟,适合弹性。一周扩一次、每次要重新加载模型,冷启动的时间成本可能比省下的钱还高。

另外弹性实例的显存规格往往受限,不一定能拿到你要的卡型。真跑生产推理,我一般建议核心负载用包月物理机托底,突发部分再挂弹性实例。像 香港自营国际物理服务器⑦ 这类 E5-2695V4、32G 内存、100M 带宽的配置,适合做推理服务的调度节点或前置处理,模型本身还放在 GPU 机器上。

几个容易踩的坑

第一个坑是把训练配置直接拿来跑推理,训练要的是大显存和大算力,推理更看延迟和并发,两者最优解不同。

第二个坑是忽略散热和功耗。双卡机器满载功耗轻松上 800W,电源和机房供电跟不上,跑几小时就降频。

第三个坑是模型加载时间。一个 13B 的 FP16 模型从磁盘读进显存,冷启动可能要一两分钟,弹性扩容时这段时间用户是在等的。

选型上,我一般先确认模型大小和日常并发,再定卡型和数量,最后才看是包月还是按量。顺序反了,钱很容易花在不需要的算力上。