从装系统到查故障:服务器运维入门该抓的那几件事

2026-10-02 16:45 1003 次浏览

刚租下一台独立服务器的人,通常会在装完系统那一刻陷入短暂的空白。IP 有了,root 密码发过来了,然后呢?有人直接丢个网站上去,等出问题再说;有人到处翻教程,结果收藏了几十篇,真到硬盘报警那天还是一头雾水。运维这件事的门槛不在命令数量,而在有没有一条能串起来的主线。我倾向于把它拆成四块:存储怎么搭、远程入口怎么管、性能怎么看、数据怎么保。这四块搭起来,一台机器就算真正交到你手里了。

先把盘和 RAID 定下来,后面才谈得上稳定

单盘和 RAID 的差别,平时感觉不到,出事那天就是全部身家。两块盘做 RAID 1,可用容量只剩一半,写入速度也不会提升,但任意一块坏了换掉重建就行,数据不丢。四块盘做 RAID 10,容量利用率 50%,换来的是读性能接近翻倍加上容错能力,数据库类负载多数会走这条路。

RAID 5 常被推荐给预算紧的人,三块盘能拿到三分之二的可用容量。我一般不建议在写入密集的场景用它,重建一块 4TB 盘动辄几个小时,这段时间里再坏一块就是全盘报废。

文件系统这块,ext4 稳妥、工具链成熟,出问题查起来资料最多。XFS 在大文件和高并发写入上更顺,很多默认镜像已经切成它了。至于 ZFS,功能强但吃内存,32G 内存的机器跑起来要留出几个 G 给它做缓存,小配置别轻易上。

远程入口和安全基线,是每天都要碰的东西

密码登录能关就关掉,改成密钥对。生成一对 ed25519 密钥,把公钥塞进 authorized_keys,私钥留在本地并设好权限 600。这一步花十分钟,能挡掉绝大多数自动化的暴力尝试。

SSH 端口改不改,其实帮助有限,扫描器是全端口扫的。真正有用的是这几条:

  • 关闭 root 直接登录,用普通账号加 sudo
  • 装 fail2ban,连续失败几次就临时封 IP
  • 防火墙默认拒绝入站,只放行确实要用的端口

系统更新别攒着。内核和 OpenSSL 这类组件的漏洞补丁,晚一周打和早一周打,风险差别很大。可以设成自动装安全更新,重启时机自己控。

如果只是跑个小站,一台 圣何塞独立服务器 配 2*E5-2697V2 和 32G 内存,月付 $206.00,做这些基线配置的练习完全够用,也不用担心把生产环境搞坏。

性能排查:先分清是算不过来还是读不过来

这是新手最容易卡住的地方。网站变慢,第一反应往往是加内存加 CPU,但瓶颈常常在磁盘 IO 上。

看 CPU,用 top 或者 htop,重点看 load average 和 %wa 这一列。%wa 高说明 CPU 在等磁盘,加核心没用。看磁盘,用 iostat -x 1,盯住 %util 和 await。%util 长期贴着 100%,说明这块盘已经跑满了。看内存,free -h 里 available 那一栏才是有意义的数字,buff/cache 占着不代表不够用。

网络层面,ss -s 看连接总数,iftop 看实时流量去向。遇到连接数异常高,多半是被扫或者有进程在反复重连。

这套顺序的价值在于省钱。判断出瓶颈在磁盘,换成 SSD 或者加一块盘做分离,比盲目升级 CPU 划算得多。反过来,如果确实是计算密集,再考虑换更高主频的型号。

备份不验证,等于没备份

备份这事最坑的地方不是没做,是做了但恢复不了。定时任务跑得好好的,真要用的时候发现压缩包损坏、或者漏掉了数据库目录。

我会坚持两件事:一是备份脚本里带上校验,生成完立刻解压测试一次;二是定期做一次完整的恢复演练,哪怕只是恢复到临时目录看一眼文件在不在。异地备份也值得做,同一台机器上的备份挡不住整机故障。

日志别只写不轮转。logrotate 配好,不然几个月后磁盘被日志撑满,服务直接起不来。这个故障太常见了,而且排查时容易想不到。

把这四块理顺,日常运维的八成问题都能自己处理。预算有限就先从一台入门独立服务器开始,把 RAID、SSH、监控、备份这套流程跑熟,再往上加机器时心里就有底了。