GPU服务器租用怎么算账:从显存到电费,一张推理部署的成本清单
打算自己跑一个模型的人,多半会在同一个地方卡住:机器到底怎么配。模型文件下载下来,参数写得清清楚楚,可一落到硬件上,问题就来了——显存装不装得下、跑起来会不会掉速、并发上来会不会直接OOM。更现实的是,如果只是阶段性用一用,买一台机器动辄几万块,闲置的时候心疼;租的话又怕算下来比买还贵。这篇文章不聊虚的,把租GPU服务器这笔账从头算一遍,让你知道钱花在哪、哪些地方能省。
显存先定生死,型号再谈性价比
判断一台机器能不能用,第一步永远是显存。模型加载进显存之后,剩下的空间才轮到KV Cache和并发请求。以7B参数模型为例,FP16推理大约占用14GB显存,一张RTX 4090 24GB能装下,但留给并发的余量就不多了。如果换成INT8量化,占用能压到7~8GB,同样的卡就能多扛几个并发。
这就是为什么不能只看卡的名字。A100 40GB和A100 80GB虽然算力相近,但能跑的模型规模完全不同——70B模型FP16需要大约140GB显存,单卡装不下,得用双A100 80GB做张量并行。租之前先把模型大小、精度、并发数三个数对一遍,比看任何评测都准。
显存够用之后,才轮到算力。很多推理场景其实是内存带宽瓶颈,不是算力瓶颈。同样跑7B模型,A100的HBM2e带宽能到1.5TB/s以上,消费级卡用GDDR6X只有1TB/s左右,token生成速度差得明显。这点在选型时容易被忽略。
按小时租还是包月,取决于利用率
算力租赁平台通常有两种计费:按小时和包月。按小时灵活,适合调试、跑实验、临时扩并发;包月单价低,但要求你持续有负载。这里的判断标准很简单——算一下你的实际利用率。
- 如果每天跑不满8小时,按小时租通常更划算,因为闲置时段不花钱
- 如果全天都有稳定推理请求,包月的单卡成本能比按小时低三成以上
我一般会建议先按小时租一两周,看真实的GPU占用曲线。很多人对自己的算力需求估计偏高,实际跑下来利用率可能只有三四成。先租后买,或者先短租再长租,比一次性押几万块稳妥得多。
还有一点:包月合同里要确认是否独占整卡。有些方案是vGPU切分,价格便宜但算力被共享,延迟波动会很大,推理服务最怕这个。独占整卡的物理服务器,跑起来才可控。
CPU、内存、带宽——容易被忽略的三笔钱
GPU是主角,但配角不到位照样出事。数据预处理、tokenizer、请求调度都跑在CPU上,如果CPU核心太少,GPU会等数据,利用率上不去。一般配比是每张卡配4~8个物理核心,具体看你的pipeline重不重。
内存也一样。模型加载时要先读进系统内存再搬到显存,内存不够会直接失败。经验值是系统内存至少是显存总量的1.5~2倍,双A100 80GB的机器,256GB内存起步比较稳。
带宽这块,如果只是内部推理、不对外提供API,普通百兆够用。但要对外服务、传模型文件、做多机通信,就得看带宽和线路质量了。多机训练时节点间通信走的是网络,带宽不够会拖慢整个训练。如果是面向国内用户的推理服务,线路的延迟和稳定性比纯带宽数字更影响体验。
如果你的业务不只在GPU上,还需要配套的海外节点做数据中转或对外服务,可以看看美国西雅图大带宽服务器 XVI,E5-2620*2 / 32G / G口配置,月付$493.50,适合做数据管道和对外接口这一层。
电费和散热,最后吃掉利润的两项
自购机器的人最容易低估这两项。一张RTX 4090满载功耗450W,双A100的整机功耗能到1500W以上。按商业电价算,一台双卡机器24小时跑,一个月电费轻松上千。机房的电费比民用电贵,还要算上制冷。
租用方案里,电费通常已经打包进价格,这也是租赁的一个隐性优势——你不需要为峰值功耗单独扩容电路,也不用担心散热压不住导致降频。热量散不出去,GPU会主动降频保护,跑分和实际吞吐能差20%以上。
所以回到开头那个问题:租还是买。我的判断是,如果利用率能稳定在七成以上、且计划跑两年以上,自购可能划算;否则租用更灵活。对多数中小团队来说,先租一个月看真实负载,比任何估算都靠谱。
落地建议
跑7B级别模型、单人调试,一张RTX 4090 24GB的按小时实例就够,预算控制在每小时几块钱。要跑70B或者做多并发服务,直接上双A100 80GB的独占物理机,别在消费级卡上硬撑。预算紧张又必须跑大模型的,先做INT8量化,显存需求能砍一半。至于机房选择,面向国内用户优先考虑延迟低的节点,做数据中转和对外服务的配套机器,可以按上面的思路挑大带宽方案。