GPU云服务器跑AI推理:显存、带宽和散热到底先卡谁

2026-10-07 11:47 1004 次浏览

部署一个 AI 推理服务,最先遇到的不是代码问题,而是机器选型。模型跑得起来但慢,或者干脆 OOM,通常不是框架写错,而是配置和负载对不上。一台 GPU 服务器上跑推理,判断它够不够用,先看显存能不能装下你要跑的模型;装下之后,内存带宽决定它跑得多快,散热决定它能连续跑几个小时不掉速。这三件事有先后顺序,搞反了就是白花钱。

显存是第一道门槛,装不下后面都别谈

7B 参数的模型,FP16 精度下权重约占 14GB,加上 KV Cache 和运行时开销,24GB 显存的卡刚好能塞下,比如 RTX 4090 24GB。换成 13B,FP16 权重就接近 26GB,单卡放不下。

这时候有两条路。一是量化到 INT8 或 INT4,显存需求大致砍半甚至更多,代价是精度有损,对生成质量敏感的场景要实测再决定。二是上双卡,比如两张 A100 40GB,用张量并行把模型切开。双卡方案贵的不只是卡钱,主板、电源、机箱散热都要跟着升级,一台机器的成本往往是单卡方案的两倍以上。

我的取舍是:如果业务对输出质量要求不极端,先试量化;量化后仍然掉点明显,再考虑双卡。

带宽和散热决定的是「跑多久」而不是「跑不跑得动」

模型装下之后,瓶颈就转移到数据搬运上。推理时每生成一个 token,都要把权重从显存读一遍,显存带宽直接决定吞吐。同代卡里,带宽高的型号单卡 QPS 可能高出三成以上,这个差距在多并发场景下会被放大。

散热更隐蔽。GPU 长时间满载,如果机箱风道设计不好,跑一两个小时就会触发降频,QPS 慢慢往下掉,但监控里看不出报错。我见过不少这样的配置:卡本身没问题,机房环境也正常,就是散热余量留得太小,连续跑满负载时性能曲线是往下走的。

  • 单卡推理:优先看显存容量和显存带宽,散热保证机箱前后风道通畅即可。
  • 多卡推理:除了单卡指标,还要看卡间互联带宽,PCIe 4.0 x16 和 NVLink 在实际吞吐上差距明显。

弹性扩展该扩在哪一层

很多人理解的弹性扩展是「不够就加卡」,但推理服务的扩展点其实分两层。模型装得下但 QPS 不够,这是并发层的问题,加机器做负载均衡比换更大的卡更划算;模型本身装不下,那才是必须升级单机配置的场景。

按我的经验,先租一个月看真实负载,比任何估算都准。流量曲线、峰值并发、平均响应时间这些数据跑出来之后,再决定是横向加机器还是纵向换卡。对于需要长期稳定运行、又不想被单机房绑定太深的业务,可以考虑香港自营物理服务器⑦,金牌6138*2 四十核八十线程、64G 内存、10M 带宽,月付 ¥1550.00,适合做推理服务的前置调度层或者小规模模型部署。

如果模型规模不大、并发也不高,一台 E5 平台的物理机加一张中端卡就能撑住,没必要一上来就上双 A100。真正烧钱的地方在买错之后的返工:卡和主板不匹配得整套换,电源带不动双卡又得加钱,来回一趟等于多花一台机器的钱。

结论:按模型大小反推,别按预算反推

7B 模型、FP16、单人使用,24GB 显存够;多人并发要往上加显存或者加卡。13B 以上,要么量化,要么双卡,没有第三条路。预算在每月一千到两千元这个区间,优先考虑物理服务器而不是云主机,因为推理负载是持续性的,物理机的单位算力成本更低。流量波动大的场景,才值得为弹性付费。