企业需部署 DeepSeek、千问模型,怎样选择硬件?成本预算大概多少?
想把 DeepSeek 或千问部署进自己内网,先别急着买卡:7B 模型 FP16 约占 16GB 显存,单张 RTX 4090 24GB 就能跑;32B 量化后约 20-24GB,单卡 48GB 或双卡更稳。到底该选多大模型、要不要量化、自建和调 API 哪个划算?显存估算、部署框架和 5 个踩坑都讲清楚了,看完能直接照着定配置。
不少公司走到这一步都差不多:业务部门说想用 AI 做知识库或者客服,IT 这边一看数据里有合同、有客户信息,往公网 API 一送就不合规,于是「私有化部署」四个字就压到了选型的人头上。真正开始做才发现,卡在第一步的不是技术,是不知道从哪下手——模型那么多尺寸,显卡价格差着好几倍,买少了跑不动,买多了利用率低得心疼。
下面这几件事我按顺序讲:先确认你到底该不该自建,再挑模型尺寸,然后是显存怎么估、框架怎么选,最后算一笔自建和调 API 的账,以及几个常见的坑。看完应该能自己定下一个大致配置和预算区间。
先确认一件事:你是真需要私有化,还是调 API 就够
私有化的理由通常就那么几条。数据不能出内网是最硬的一条,合同、代码、病历这类东西发给第三方接口,合规上过不去。另一条是调用量特别大且稳定,自建摊薄之后单次成本可能比按 token 付费低。还有一条是想要微调出企业专属模型,这个 API 给不了。
反过来,如果只是内部几个人的知识助手,调用量零零散散,那 API 反而更省心,不用养机器也不用管运维。这点我一般会先跟业务方确认清楚,因为一旦走上自建,后面就是持续的电费和人力,不是一次性买台机器就完事。
模型尺寸怎么挑:先用够用的,别一上来就追 671B
开源模型里,千问系列尺寸最齐,从 0.5B 到 72B 都有,中文表现好,生态也全,多数企业拿它当起点比较稳。DeepSeek 的 V3 和 R1 属于超大 MoE 架构,激活参数少但综合能力强,R1 在推理类任务上更突出,代价是算力门槛高。GLM 系列中等规模,中文对话和工具调用做得不错。
选型我自己的顺序是:先用能满足效果的最小尺寸跑起来,验证完再往上加。中文业务要落地快,千问 14B 到 32B 是稳妥的起步档;要顶级推理能力、算力也充足,再考虑 DeepSeek-R1 或 V3;高并发、低延迟又想省钱,蒸馏小模型配多实例是常见做法。
显存是硬门槛:不同尺寸要几张卡
这一节是整篇里最该看仔细的地方,因为钱主要花在这。显存装不下模型,后面什么优化都白搭。下面这个估算含了 KV 缓存的余量,实际还会受上下文长度、并发数和量化方式影响,按规划用可以,别当成精确值。
- 7B:FP16 约 16GB,INT4 量化后约 6 到 8GB,单张 RTX 4090 24GB 就够
- 14B:FP16 约 30GB,量化后约 10 到 12GB,单张 24GB 到 48GB
- 32B:FP16 约 70GB,量化后约 20 到 24GB,单张 48GB 或双卡
- 70B:FP16 约 150GB,量化后约 40 到 48GB,单张 80GB 或 2 到 4 卡
- DeepSeek-V3 671B MoE:显存需求极大,数百 GB 起步,通常要 8 张 80GB 整机
量化能把显存砍下来一大截,INT8、INT4、FP8 都有人用,代价是可能轻微掉精度,所以业务上要先做效果验证再定。按我的经验,大多数企业的知识库、客服、写作场景,32B 级别加量化就相当够用了,一台机器配一到两张 48GB 或 80GB 的卡能跑起来。为了「跑满血 671B」买一柜子卡,最后利用率只有个位数,这是最典型的浪费。
如果只是小团队试水或者做内部知识助手,千问 7B 到 14B 加量化,配一张 24GB 到 48GB 的卡就能先转起来。这类轻量场景对机房的要求不高,像 新加坡大带宽云服务器 ⑮ 这种 4H / 8G、月付 $19.13 的配置,适合先做小规模验证和外围服务,把效果跑通再决定要不要上物理机。
部署框架:开发用哪个,生产用哪个
框架这块的选择其实不复杂。vLLM 吞吐高、并发强,是生产部署里用得最多的一档;SGLang 在结构化输出和高并发复杂推理上表现好;Ollama 一行命令就能起,本地开发和演示最方便;LMDeploy 在量化和国产硬件适配上做得细。
开发验证阶段用 Ollama 最快,但别把它直接搬到生产上。同样的卡,Ollama 跑 demo 很顺,一到高并发吞吐就撑不住,生产环境一般还是要换成 vLLM 或 SGLang。这个切换要提前规划,别等上线了才发现。
自建还是调 API:算一笔账再决定
自建的成本是硬件一次性投入,加上持续的电费、运维和人力。API 是按 token 用量付费,用多少算多少。分界点大致是这样:调用量小或者波动大,API 更省;调用量大且稳定,同时数据必须留在本地,自建摊薄后更划算;如果是强合规场景,数据绝对不能出内网,那自建基本是唯一选项,成本反而排第二位。
有个简单的比法:把每月 API 账单乘以 18 到 24 个月,跟一台 GPU 服务器的整机价加电费放一起看,再叠上合规带来的价值,该不该自建就比较清楚了。GPU 服务器是实打实的电老虎,TCO 不止硬件钱,这点在预算里要留出来。
五个落地时最容易踩的坑
- 模型选太大:追 671B 满血,结果几十万的卡利用率只有个位数。先用够用的尺寸跑起来。
- 只买卡不算并发:同样的卡,并发 1 和并发 50 的体验差得很远,要按真实并发和上下文长度规划显存。
- 忽略量化:不量化白白多花几倍显存,先量化验证效果,达标就用省卡的版本。
- 拿开发框架上生产:Ollama 跑 demo 舒服,高并发生产要换 vLLM 或 SGLang,否则吞吐顶不住。
- 没算电费和运维:机器要人维护,电费是持续的,预算里别只写硬件。
强合规加大调用量的场景,最后往往是自建 GPU 集群配私有化知识库平台,数据全程不出内网。这种规模下机房和网络的稳定性就变得重要,像 新加波高防服务器 VI(E5-2698v4*2 / 64G / 50M,月付 $349.00)这类配置,适合承载对稳定性和带宽都有要求的业务节点,具体上不上还要看并发和预算。
按场景给几个能直接用的配置
小团队试水或者内部知识助手,千问 7B 到 14B 加量化,配 Ollama 或 vLLM,单张 24GB 到 48GB 的卡就能起步。企业知识库和智能客服这类中等并发场景,千问 32B 量化加 vLLM,单机一到两张 48GB 到 80GB 的卡比较合适。
要求高、任务复杂、多条业务线共用的,上千问 72B 或 DeepSeek-R1,按并发往上扩卡。强合规加上大调用量的,直接规划自建集群加私有化知识库平台。
一句话收尾:预算有限就先租一个月或者先上小尺寸验证真实负载,比任何估算都准;数据能出内网、调用又不稳定的,别急着买卡,API 更划算。真要自建,先把显存算清楚再下单,这一步省下的返工钱比什么都多。