服务器运维从零上手:先把这四件事做对,再谈自动化

2026-10-05 07:30 1011 次浏览

买完服务器、SSH 能连上,很多人第一反应是赶紧装宝塔或者跑个一键脚本。我见过不少这样的配置:面板装好了,站点也起来了,结果半年后磁盘写满、SSH 端口被爆破、进程被 OOM 杀掉,才发现从一开始就没打地基。运维这件事不是会敲多少命令,而是知道哪几件事不做,后面一定要还债。

这篇讲的是最小可用的运维底子:一台新机器到手,按顺序把四件事做对,再谈自动化、再谈面板。顺序错了,后面补的成本会翻倍。

第一件事:磁盘分区和挂载点,决定你半年后会不会被写满

默认装系统时如果一路下一步,通常只给根分区留几十 G。日志、数据库、网站附件全挤在同一个分区,跑三个月就报警。

我的习惯是先规划三个位置:系统盘、数据盘、日志盘。数据盘单独挂 /data,日志走 /var/log 或者单独一块盘。这样即使日志暴涨,也不会把系统盘撑死导致 SSH 都连不上。

具体代价很直接:根分区写满之后,系统连写日志的空间都没有,很多服务直接起不来,你只能进救援模式清文件。而提前分好盘,多花的时间不超过十分钟。

以香港自营国际物理服务器⑭ 的 E5-2696V4 双路(44 核 88 线程)配 64G 内存为例,这台机器通常会给到大容量硬盘,拿来做分区规划的空间很充裕,跑几十个站点的日志也压得住。

第二件事:SSH 密钥登录 + 改端口,比装任何安全软件都实在

密码登录配上默认 22 端口,等于把门牌号贴在门口。肉鸡扫描器一天能试几万次,日志里全是 failed password。

要做的就两件:

  • 生成密钥对,把公钥写进 ~/.ssh/authorized_keys,然后关掉密码登录
  • SSH 换一个 10000 以上的端口,防火墙只放行这个端口

关掉密码登录这一步很多人下不去手,怕自己密钥丢了进不去。我的做法是:先确认新端口 + 密钥能正常登录,开一个新的终端窗口验证一遍,再改配置文件。别在同一个窗口里改完就退出。

这两步做完,爆破日志基本归零。省下的是每天翻日志的时间和被撞库成功的概率。

第三件事:防火墙先默认拒绝,再逐条放行

很多教程教的是「先全开,出问题再加规则」,这个顺序是反的。正确姿势是默认拒绝所有入站,然后只放你要用的端口:SSH 的新端口、Web 的 80 和 443,其余一律不开。

数据库端口尤其要注意。3306、6379 这类端口暴露在公网,是被挖矿脚本扫得最狠的。要么只监听 127.0.0.1,要么在防火墙层面挡掉。

这里有个取舍:默认拒绝会让调试变麻烦,加一条规则要重启一次。但换来的是攻击面从「全开」缩到「两三个端口」,这笔账怎么算都值。

第四件事:监控和告警,让你在用户投诉之前知道出事

没有监控的运维就是盲开。CPU 打满、磁盘 90%、内存吃紧,这些信号如果不主动推给你,等你知道的时候通常是客户先发现。

零基础不需要一上来就上 Prometheus。先用最轻的方式把四个指标盯住:CPU 负载、内存使用率、磁盘剩余空间、网络进出流量。写个五分钟跑一次的脚本,超过阈值就发邮件或者推送到手机。

告警阈值我一般这样设:磁盘剩余低于 20% 就报、内存持续五分钟超过 85% 就报。报得太频繁会麻木,报得太晚没意义,这个度要自己调一两轮。

把这四件事做完,一台机器的底子就算打好了。接下来再装面板、再上自动化部署,都是在稳固的地基上盖房子。

至于什么时候该升级硬件:当你发现 32G 内存常年跑到 80% 以上、或者单核负载长期压不下来,说明该换配置了。像香港自营物理服务器(50M)③ 的 E5-2650L 双路 16 核 32 线程配 32G 内存,适合中小规模站点起步;业务再往上走,就得考虑 64G 内存加更多核心的机型。

结论很直白:刚上手独立服务器的人,先把这四步走完再碰别的;预算有限就先租一台中等配置练手,别一上来就买顶配。真正该花时间的是把运维习惯养对,硬件随时可以换,坏习惯换不掉。