GPU服务器租用与算力租赁:从显存到成本,一次讲清楚
去年还能用一张消费级卡糊过去的推理任务,今年动辄就要几十GB显存起步。自建整机的账单摆在面前:一张能装下模型的卡加上匹配的主板、电源和散热,整套下来够租好几个月。于是越来越多做AI应用的小团队开始考虑GPU服务器租用,但租之前得先搞清楚一件事——你的任务到底吃哪块资源。
先看显存装不装得下,这一步错了后面全白搭
7B参数的模型用FP16推理,权重本身大约占14GB显存,加上KV Cache和框架开销,实际要留出16GB左右。这意味着RTX 4090的24GB能比较从容地跑单路7B,甚至塞下量化后的13B。但如果你要跑70B,即便用4-bit量化,权重也要35GB上下,单卡就得考虑A100 80GB这个级别。
我一般建议先算清楚三件事:模型参数量、量化精度、并发路数。三者任一变化,显存需求就跟着跳。
- 7B FP16:约14GB权重,24GB卡可跑,留余量给并发
- 13B FP16:约26GB权重,单张24GB卡吃不下,得双卡或量化
- 70B 4-bit:约35GB权重,A100 80GB单卡较稳,双卡更从容
显存不够的直接后果不是慢,是根本加载不起来,或者频繁触发CPU offload,速度掉到没法用。这是租GPU时第一个要卡死的硬指标。
显存够用之后,内存带宽和散热决定它跑得多快、跑多久
同样装得下7B,为什么有的机器每秒出几十个token,有的只有个位数?差距往往在显存带宽。RTX 4090的显存带宽约1TB/s,A100 80GB是2TB/s级别,H100更高。带宽越大,权重搬运越快,出词速度越接近理论上限。做实时对话类应用,这个数字直接决定用户体验。按我的经验,7B模型要做到流畅对话,显存带宽最好不低于800GB/s。
散热经常被忽略,但它管的是可持续性。GPU满载时功耗能冲到300W以上,双卡就是600W往上。机房风冷压不住,芯片会降频,跑十几分钟速度就掉一截。租的时候问清楚机房是风冷还是液冷、单机柜能给多少电力,比只看卡型号实在得多。这点我没法一概而论,不同机房差异很大,签合同前最好要求看实时温度和降频记录。
买卡还是租算力,算一笔三年的账
自建一台双A100整机,硬件投入通常在十几万到二十几万,还不算机房托管、电费和运维人力。如果项目处于验证期,负载不稳定,这笔钱压下去风险不小。租算力按月付费,试错成本低,但单价高,长期跑满反而不划算。
我的判断标准是看负载曲线。日均GPU利用率长期超过六成,自建更省;波动大、或者还在找方向,先租。秀米云的香港自营国际物理服务器⑨配的是金牌6138(20核40线程)、32G内存、100M带宽,月付1050元,适合拿来做推理服务的前端调度和中小规模CPU侧任务,GPU卡可以按需外接或另配。如果任务主要在海外用户侧,美国西雅图的大带宽服务器 XIII给到G口带宽,月付523.50美元,适合把数据预处理和结果分发放在离用户近的地方。
按场景给结论,别为用不上的算力买单
个人开发者跑7B微调或推理,一张24GB卡够用,优先租单卡按小时或按月,别一上来就双卡。中小团队做多路并发推理,两条路:要么双24GB卡分摊,要么单张A100 80GB集中处理,前者便宜但调度复杂,后者贵但省心。做70B以上大模型或训练任务,直接上A100/H100多卡,这时候租比买更常见,因为单次训练周期短、硬件折旧快。
预算有限又必须跑大模型,用量化换显存是现实选择,4-bit能把70B压到35GB左右,代价是精度有损,得自己评估业务能不能接受。最后提醒一句:签租用合同前,确认计费是按整机还是按卡、超时怎么算、数据能不能随时导出。这三点没谈清楚,后面容易扯皮。