服务器运维入门:从远程登录到故障排查的实操路线

2026-10-10 22:39 1007 次浏览

很多人拿到第一台服务器,第一反应是搜「一键安装面板」,装完发现端口全开、root 密码是弱口令,跑了两周被人扫进去挖矿。运维这件事的门槛不在命令多难,而在顺序——先做什么、后做什么,做错了要返工,返工的成本往往比机器本身还高。下面按一台新机器到手之后的真实顺序讲,每一步都对应一个具体的坑。

第一步不是装环境,是把入口收窄

新机器交付时会给你一个 IP 和 root 密码。这个组合只在最初十分钟有效,之后必须换掉。

我一般的做法是先在本地生成一对密钥,把公钥传上去,然后关掉密码登录。这一步不做,后面所有安全配置都是纸糊的。密码登录开着,等于把门虚掩着,扫描器一天能试上万次。

接着处理端口和防火墙。默认 22 端口是全网扫描的重点,换成 20000 以上的高端口能挡掉大部分自动化脚本。真正的防护还是防火墙规则:只放行你实际用到的端口,其余一律拒绝。

  • Web 服务:80、443
  • 数据库:只允许内网或指定 IP 访问,不要对公网开放 3306、6379
  • 管理端口:换成高位端口,并限制来源 IP

这三件事做完,机器才算「可以开始用」。顺序反了,先装了一堆服务再回头收权限,很容易把某个依赖的端口一起关掉,服务莫名其妙挂掉,排查半天。

监控不装,等于闭着眼开车

运维里最贵的不是硬件,是「你不知道它什么时候会挂」。磁盘写满、内存泄漏、带宽跑满,这三类问题在爆发前通常有几天甚至几周的征兆,前提是有人在看曲线。

零基础阶段不用上复杂的监控系统,装一个轻量的采集脚本,把 CPU、内存、磁盘、网络四个指标每 5 分钟记一次,存成本地文件就够。关键是养成看趋势的习惯:磁盘占用是不是每周涨一点、内存是不是重启后慢慢爬。

磁盘写满是最常见的宕机原因,而且最难查。日志文件、临时文件、数据库 binlog,三个地方轮流膨胀。我见过不少这样的配置,根分区只给了 20G,跑几个月就被日志填满,系统直接拒绝写入,SSH 都登不上去。

所以分区的时候,把 /var 和 /home 单独分出来,别全塞在根分区。这一步在装机时是免费的,事后调整要停机。

如果还在选机器阶段,香港机房的 香港自营物理服务器(100M)③ 是 E5-2650L 双路 16 核 32 线程、32G 内存、100M 带宽,月付 3600 元,这个配置跑中小型业务和自建监控都够用,重点是物理机不用担心邻居抢占资源。

故障排查:先看日志,再动配置

出问题的第一反应不该是重启。重启能解决 80% 的问题,但会让 100% 的线索消失。

CPU 跑满,先看是哪个进程。用 top 按 CPU 排序,记下 PID,再去看这个进程在干什么。多数情况是某个脚本死循环,或者被扫到了漏洞在跑挖矿程序。这时候要做的不是 kill 掉就完事,而是查它怎么进来的。

内存问题反过来,通常表现为服务被系统 OOM killer 干掉。日志里搜「Out of memory」能确认。这种情况要么加内存,要么限制进程的内存上限,让它自己崩而不是拖垮整机。

网络不通分两层查:先在本机 ping 网关,通说明机器网络栈没问题;不通就查路由和网卡配置。本机通、外面不通,多半是防火墙或上游策略。

这套排查顺序的价值在于,它能让你在十分钟内定位到大概方向,而不是东改一处西改一处,最后把配置改乱了只能重装。

重装一次的成本,不只是数据丢失,还有重新配环境、重新调服务、重新等业务恢复的时间。按我的经验,一台跑着正式业务的机器,非计划重装的隐性损失远超一个月的机器租金。

什么时候该上物理机

入门阶段用云主机练手没问题,成本低、随时重装。但业务稳定下来之后,有两个信号说明该考虑独立服务器了:一是性能波动明显,同样负载白天慢晚上快;二是单机资源经常触顶,加钱升配的边际成本越来越高。

物理服务器的逻辑是资源独占,CPU、内存、磁盘 IO 都是你自己的,不会因为同宿主机上别人跑满而受影响。代价是弹性差,扩容要换机器,不能像云主机那样点一下就加 2G 内存。

所以判断标准很清楚:业务量稳定、对性能一致性要求高,选物理机;业务波动大、需要快速伸缩,留在云上。这个取舍想清楚,比纠结具体型号重要得多。