Beszel 装完就没再管过:一台轻量监控工具的真实用法

2026-09-29 19:27 1003 次浏览

手上机器一多,最先出问题的往往不是性能,而是「不知道哪台在偷偷出状况」。磁盘写满、内存被某个进程吃光、带宽跑满,这些事不会主动通知你。有人会先上一套 Prometheus 加 Grafana,结果发现自己花在维护监控系统上的时间比维护业务还多。如果你的需求只是「知道每台机器活着、资源用了多少」,Beszel 这类工具反而更省事。

它到底解决什么问题,不解决什么问题

Beszel 的定位很清楚:轻量、易用。Hub 端负责存数据和展示,Agent 端装在每台被监控的服务器上,只做上报,不做采集计算。用 Go 写的,单二进制部署,跑起来内存占用通常不到 50MB,对业务几乎没有干扰。

能看的东西包括 CPU 使用率、内存、磁盘占用、网络进出流量,以及 Docker 容器的运行状态和资源消耗。历史数据会保留,可以按时间范围回看。告警支持阈值触发,也能推到常见的通知渠道。

它不解决的也很明确:没有分布式追踪,没有链路分析,没有复杂的 PromQL 查询,也不做日志聚合。想要这些,得上另一套东西。我一般会先问一句「你是想知道机器健不健康,还是想查业务为什么慢」,答案不同,工具选择完全不同。

安装这件事,控制在十分钟内

Hub 端最省事的方式是 Docker 起一个容器,挂一个数据卷持久化,然后开放端口。Agent 端在每台服务器上跑一个二进制或者容器,填上 Hub 地址和密钥就行。

真正需要注意的只有两处。一是 Agent 到 Hub 的连通性,如果被监控的机器在海外机房,Hub 放在本地,中间的网络质量会直接影响数据上报的稳定性;反过来把 Hub 放在被监控机器同区域的机房里,延迟通常只有几毫秒,最省心。二是密钥和端口的暴露面,Hub 的 Web 面板不要直接开在公网裸奔,至少加一层访问控制。

按我的经验,十台以内的机器,一个人从零装到能看板,半小时足够。超过这个规模,批量部署 Agent 的脚本值得提前写好,不然重复劳动很烦。

哪些机器值得交给它,哪些不值得

判断标准不是机器性能,而是这台机器「出事之后你多久能发现」。

  • 长期跑着但没人天天登录的机器,比如备份机、跳板机、日志归档机,最适合。这类机器出问题往往几天后才发现,监控的价值最大。
  • 跑着若干 Docker 容器的小型业务机也合适,容器挂了能第一时间看到,比等用户来反馈强得多。
  • 核心交易链路或者对延迟极度敏感的业务,Beszel 的采集精度和告警能力不够用,得另配一套更完整的方案。

还有一种情况容易被忽略:临时开的机器。有人觉得用几天就关了,不值得装监控。恰恰相反,临时机器最容易被遗忘,磁盘写满、进程挂掉都没人管,装上反而省心。

告警阈值别照抄默认值

这是最容易踩的坑。默认阈值通常是给通用场景设的,放到具体业务上经常误报或者漏报。

磁盘告警,如果设成 90%,对于日志增长快的机器可能一晚上就从 60% 冲满,根本来不及处理。我的做法是按增长速度倒推,比如每天涨 2%,那 75% 就该提醒。内存告警要区分「用满」和「缓存占满」,Linux 的 buff/cache 算进已用内存会误导判断,看 available 更准。

网络流量告警对独立服务器尤其重要。很多机器是固定带宽,跑满之后业务直接卡死,但流量曲线往往是缓慢爬升的,等到用户投诉已经晚了。设一个相对带宽上限 80% 的阈值,能提前一两天收到信号。

告警渠道也别只挂一个。邮件容易被忽略,即时通讯渠道响应更快。我一般会先只开关键几项,跑一周看误报率,再逐步加,一上来全开的结果通常是告警疲劳,最后谁也不看。

它和「另一套完整方案」怎么分工

现实里多数团队是两套并存:Beszel 管机器层的健康和资源,另一套管业务指标和链路。两者不冲突,反而能互补,因为关注的问题根本不同。

如果机器本身跑在海外机房,比如东京、西雅图这些位置,Hub 端和 Agent 端的部署位置值得想一下。把 Hub 放在同一区域,上报延迟低、数据连续性好。秀米云的日本东京服务器7(E5-2698v4*2 / 64G / 20M)这类配置,拿来跑一个监控 Hub 加若干轻量服务绰绰有余,20M 带宽对纯上报数据流也够用。美国方向的业务,西雅图裸机云服务器 III(E5-2680 / 32G / 100M)月付 $99,带宽更宽,适合被监控机器数量多的场景。

要提醒的是,监控 Hub 本身也是一台机器,也会挂。它挂了你就瞎了,所以这台机器要么配好自愈,要么至少加一个外部心跳检测。这点很多人装完就忘了。

收尾:什么时候该上,什么时候别上

机器数量在 5 台以上、又不想在监控系统上投入人力,Beszel 是性价比很高的一档,部署成本基本就是一台低配机器的钱。单机用户或者只是偶尔看看资源,系统自带的 top、df 命令就够了,装一套反而是负担。

预算上,Hub 端跑在一台月付几十美元的机器上完全够用,真正的成本是你的时间——装一次、调一次阈值,之后基本不用再管。如果业务已经复杂到需要看调用链和业务指标,那就别指望用轻量工具硬扛,直接上完整的可观测性方案,省下的折腾时间远比省下的机器钱值钱。