AI服务器真要上GPU吗?我见过不少配置卡在预算和散热上

2026-09-23 12:42 1003 次浏览

准备做AI推理的团队,通常是在模型跑通、准备上线的阶段卡住。这时候面对的第一个问题不是算法,而是机器怎么配。销售给的方案从单卡到八卡都有,报价跨度能到十倍,谁都不想买回来发现跑不动,或者买贵了发现一半算力闲置。

选型这件事没有统一答案,但有判断顺序。先看你的模型能不能装进显存,再看它跑起来之后带宽和散热跟不跟得上,最后才考虑要不要横向扩展。顺序颠倒,钱基本都会花错地方。

先算显存:模型装不装得下,决定你要不要上多卡

7B参数的模型用FP16推理,权重本身大约占14GB显存。这意味着单张24GB的卡能装下,还能留出几GB给KV缓存。换到13B,FP16下权重接近26GB,24GB的卡就装不下了,要么量化到INT8压到13GB左右,要么上双卡。

70B级别的模型,FP16权重约140GB。单卡想都别想,至少两张80GB的卡做张量并行。这个量级直接决定了你的整机预算会从几万跳到几十万。

按我的经验,多数做垂直场景的团队,真实需要的推理规模比自己估的低。模型是7B还是13B、并发是几个人还是几十个人,这两个问题先问清楚,能省掉一半的硬件预算。

带宽和散热:决定能跑多快、能连续跑多久

显存够了之后,速度瓶颈往往不在算力,而在显存带宽。同样一张卡,跑同一个模型,批处理大小调大一点,吞吐能翻倍,但显存占用也跟着涨。这就是为什么有人用4090跑得挺顺,有人同样的卡却总觉得慢——差别在参数和批大小怎么调。

散热是另一个容易被低估的点。单卡4090用风冷没问题,双卡挤在一个机箱里,长时间满载很容易触发降频。降频之后推理延迟会往上跳,P99延迟尤其明显。

判断一台机器够不够用,我一般先看显存能不能装下模型;装下之后,带宽决定它跑得多快,散热决定它能不能连续跑几个小时不掉速。这两条任何一条出问题,加钱买更贵的卡都补不回来。

单卡起步还是直接上整机:钱该花在哪一步

如果只是验证效果或者内部小规模使用,单张24GB的卡起步完全够。整机成本大致在几万元区间,配上合适的电源和机箱,跑一两个月看真实负载,再决定要不要加卡。

真正烧钱的地方在买错之后的返工。卡和主板不匹配得整套换,电源带不动双卡又得加钱,来回一趟等于多花一台机器的钱。

需要长期稳定跑、并发又上来的场景,才值得考虑整机方案。海外部署的话,机器放在哪个机房同样影响体验,线路延迟高的地方,推理再快,用户端还是等。

  • 单卡24GB:适合7B级别的模型,内部使用或小并发
  • 双卡80GB:适合13B以上、需要稳定并发的线上服务

如果业务本身是面向海外用户的,机房位置和线路质量要提前定下来。需要海外独立服务器承载推理服务的,可以看看法国VPS(巴黎机房)这类方案,2核心4G10M独享月付12.70美元,适合做前置服务或小规模验证;真要跑GPU推理,还是得本地或托管整机。

收尾给个能直接执行的判断:模型在13B以内、并发个位数,单张24GB的卡配好散热就够,预算控制在几万元;模型上到70B或者并发几十路,直接按双卡80GB规划,别指望量化硬撑,延迟会教做人。机房选在用户集中的区域,这一条比多买一张卡更影响体验。