Beszel 实测:轻量监控怎么装、看什么、什么时候该换重型方案

2026-10-05 10:45 1008 次浏览

手里攒到第三四台海外服务器之后,多数人都会经历同一个阶段:机器能跑,但出问题永远是最后一个知道。磁盘写满、内存被某个进程吃光、带宽跑满导致网站打不开,这些事不会主动通知你。上 Prometheus 加 Grafana 是一劳永逸的解法,可一台 1 核 1G 的香港小机器,光这两个组件就能吃掉 1.5GB 到 2GB 内存,监控本身先把资源占了。我一般会先问一句:你现在到底有几台机器要盯?如果是个位数,上重型监控属于给自己找活干。

Beszel 就是在这个空档里冒出来的方案。Hub 加 Agent 两个二进制,Hub 端自带 Web 界面和 SQLite 存储,Agent 端几十兆内存常驻,部署完基本不用再管。这篇把安装路径、实际能看什么、以及它撑不住的场景分开讲清楚。

装之前先算一笔资源账:省下的内存够再开一个站

Beszel 的 Hub 端官方给的资源占用大致在 30MB 到 50MB 内存区间,Agent 更低,通常是 10MB 到 20MB。对比一下,Prometheus 单进程在采集几十个指标后通常要 200MB 起,Grafana 再叠 150MB 到 300MB,加上时序库的磁盘增长,一台小机器很容易被监控拖到换配置。

这笔账在什么情况下值得算?当你用的是 1 核 1G 或者 2 核 2G 的入门机器时,省下的 1.5GB 内存意味着还能多挂一个静态站或者跑个轻量 API。如果你手上已经是 32G 内存的独立服务器,那点开销无所谓,选谁更多是看功能而不是看占用。

我见过不少这样的配置:主站放在香港,备份和测试机散在日本、美国,每台单独登上去看一遍状态,一周下来光 SSH 都要开十几次。Beszel 的价值就在这一步——把分散的机器收进一个面板,而不是替代完整的可观测体系。

部署本身不复杂,Hub 提供一个二进制加一个 SQLite 文件,Agent 通过 SSH 或者手动安装接入。真要落到海外机器上,网络这一层反而更值得先确认:Agent 上报数据走的是 Hub 的端口,如果 Hub 放在国内而 Agent 在海外,上报延迟和丢包会直接影响曲线连续性。我一般建议 Hub 跟被监控的机器放在同一区域,比如都在香港,或者都在美国。

装完能看什么:五项基础指标 + 容器状态,够用但不全能

打开面板之后,能看到的指标大致是这几类:

  • CPU 使用率与负载曲线,按核心数展示
  • 内存与 Swap 占用,能看出是否在偷偷换页
  • 磁盘使用率与读写速率
  • 网络进出流量,用来判断带宽是否被打满
  • Docker 容器的运行状态与基础资源占用

这套指标覆盖的是「机器还活着吗、资源还够吗」这两个问题。对个人站和中小业务来说,这两个问题占了日常排查的八成。剩下两成——比如某个接口的 P99 延迟突然升高、数据库慢查询变多——Beszel 管不了,那属于应用层监控的范畴。

告警是它比较薄的地方。Beszel 支持基础阈值告警,能推到邮件或者 Webhook,但没有分级、没有静默期、没有值班轮换。这意味着它能告诉你「出事了」,但没法告诉你「这件事比那件事更急」。业务对可用性要求高的时候,这一层缺失是要拿真金白银去补的。

长期存储也是同样的取舍。SQLite 存近期数据没问题,想留半年的历史曲线做容量规划,就得定期导出或者干脆换方案。我的判断是:Beszel 适合看「现在」,不适合看「过去一年」。

如果被监控的是香港本地的业务机,机器本身选得稳一点,监控的价值才体现得出来。像 香港物理服务器 VII 这类 E5-2678V3 双路、32G 内存的配置,跑几个容器加一个 Beszel Hub 完全不占资源,10M 带宽也够 Agent 上报。要是流量本来就大,比如做视频分发或者下载站,那监控的重点会从 CPU 转到带宽曲线上,机器侧建议直接看 香港大带宽服务器 XXII 这种 G 口配置,E5-2630L 双路加 32G,带宽打满时 Beszel 的网络曲线能第一时间给出证据。

什么时候该放弃它:超过 20 台、要做容量规划、要告警分级

轻量工具都有边界,Beszel 的边界大致在这三条线上。

第一,机器数量上去之后,Hub 单点的问题会暴露。SQLite 写入在几十台 Agent 高频上报时开始吃紧,面板加载也会变慢。这个数量级没有精确阈值,取决于上报间隔,但按我的经验,单 Hub 带 20 台以内比较舒服,再多就该考虑分片或者换架构。

第二,需要做容量规划的时候。判断「下个月要不要升配」,看的是过去几个月的内存增长趋势和带宽峰值分布,这要求长期存储和聚合查询能力,SQLite 加近期数据的组合给不了。

第三,团队协作场景。多人值班、告警分级、事件回溯,这些是重型监控的强项。Beszel 在这块基本是空白,硬上只会让人手动转发告警。

反过来,如果只是个人或者两三个人的小团队,机器在十台以内,主要诉求是「别等用户告诉我网站挂了」,Beszel 的性价比很难被超过。装它的时间成本大概半小时,之后基本零维护。

最后给一个可以直接执行的结论:机器少于 10 台、预算紧、只想看基础资源,选 Beszel,Hub 放在跟业务机同一区域;机器超过 20 台、有值班要求、要做容量规划,直接上 Prometheus 那一套,别在轻量工具上反复加补丁。中间那段——10 到 20 台——可以先上 Beszel 顶着,同时把指标格式统一好,将来迁移不至于推倒重来。