从零接手一台服务器:运维新手先搞懂这几件事,少走半年弯路
很多人第一次拿到服务器,是在一个很尴尬的时刻:项目已经上线在即,老板把 IP、root 密码和一句「你搞一下」丢过来,剩下的全靠自己摸索。真正让人卡住的不是不会敲命令,而是不知道先做哪一步——是先装环境,还是先改 SSH 端口,还是先配防火墙?顺序错了,后面每一步都在补窟窿。
我接手过不少别人配了一半的机器,最常见的状态是:面板装好了,网站能打开,但 root 密码还是初始那串,22 端口对全网开放,没有任何备份。这种机器不出事只是运气好。下面按我自己的习惯,把从拿到机器到能放心跑业务的流程拆开讲,重点放在判断和取舍上,命令只是顺带。
先把门锁上,再谈装什么软件
拿到机器第一件事不是装宝塔,也不是配 Nginx,而是把登录入口收紧。公网上的 22 端口每天会被扫几千次,弱密码机器通常在几小时内就被挂上挖矿程序。
我一般按这个顺序做:
- 新增一个普通用户并加入 sudo 组,确认能登录后再决定要不要禁用 root 直连
- 把 SSH 改成密钥登录,密码登录关掉;这一步做完再改端口,避免把自己锁在外面
- 防火墙默认拒绝入站,只放行 SSH、HTTP、HTTPS 这些确实要用的端口
为什么强调「确认能登录后再禁用」?因为改 SSH 配置出错导致自己被关在门外,只能走控制台的 VNC 救援,那是最费时间的返工。多花五分钟开一个新终端验证,能省掉一次半夜的紧急处理。
系统盘和数据盘要分开想
新手常犯的错是把所有东西都堆在系统盘。日志、数据库、网站文件全在 / 下面,跑上几个月磁盘满了,系统直接卡死,连 SSH 都进不去。
我的做法是:系统盘只放操作系统和基础软件,业务数据单独挂一块盘,日志做轮转,超过 7 天或 500MB 就归档。这样即使日志暴涨,也是数据盘先报警,不会把系统拖垮。物理服务器在这点上比小配置云主机舒服得多,你可以自己加盘、自己分区,不用看别人脸色。
如果是香港节点跑面向大陆用户的业务,一台 香港原生IP物理服务器 ③ 用 Intel Xeon E5-2698V3 加 32G DDR4、20M 带宽,月付 $243 这种配置,拿来练手或者跑中小型站点都够用,盘位和内存都留了扩展余地。
监控和备份,二选一的话先做备份
这是我最有感触的一条。监控能让你提前发现问题,备份能在你发现不了问题的时候救你一命。预算和时间有限时,先做备份。
备份要满足两个条件才算数:一是存在另一台机器或另一个位置,二是定期验证能不能恢复。只把数据拷到同机另一个目录,那不叫备份,磁盘一坏全没。
监控方面,起步阶段不用上复杂系统。CPU、内存、磁盘、带宽四个指标,加一个进程存活检查,就能覆盖大部分故障。真正值钱的是告警阈值设得合理——磁盘到 80% 就提醒,而不是等到 95%。
什么时候该用物理服务器,什么时候不该
运维入门阶段,我倾向于先用一台独立服务器把整套流程跑通。原因很实际:物理机的资源是独占的,CPU 抢不到、内存不会被邻居挤占,排查问题时变量少。你装一个数据库,性能就是这台机器的性能,不用怀疑是不是被同宿主机的其他实例影响了。
反过来,如果你的业务有明显的波峰波谷,比如白天访问量是夜里的十倍,那弹性伸缩的云主机更划算,物理机在低谷期是浪费。选哪种,取决于你的负载曲线是平的还是尖的,而不是取决于哪个听起来更高级。
按我的经验,月付一两百美元这个区间,与其纠结配置参数,不如先把运维流程标准化:密钥登录、防火墙、独立数据盘、异地备份、四项监控。这套东西搭好,换任何一台机器都能快速复制,这才是「精通」和「会用」的分界线。