五台服务器的分工与值守
把机器当成同事来管:谁干什么,谁不能越界。
机器一多,最先崩的不是性能,是"谁负责什么"。我给自己定了一张表:每台机器只有一个主要身份,出问题先找它的主人。
分工表
| 代号 | 身份 | 出事影响 |
|---|---|---|
| 生产 | 业务系统与数据库 | 客户直接不能用 |
| 门户 | 工作台、消息链路、AI 助手 | 我看不见、指挥不动 |
| 门店 | 门店收银与会员 | 门店当场卡住 |
| 分厂 | 另一套业务系统 | 单点受影响 |
| 保险柜 | 备份、监控哨兵、代码托管 | 数据安全底线 |
公开的地方我只写代号,不写 IP。这不是矫情,是省事:能公开的信息越少,需要防的面就越小。
值守的三条铁律
- 改配置不等于改代码生效,唯一可信的证据是访问日志,不是"进程还在"。
- 停旧之前先验新,停旧不可逆,起新失败就是事故。
- 长任务只看产物,不看退出码、不看收尾回显。
每天一次的快检
for h in prod portal shop factory vault; do
printf '%-8s ' "$h"
ssh "$h" 'uptime -p; df -h / | tail -1; systemctl is-active caddy >/dev/null 2>&1 && echo caddy:ok'
done这套东西不优雅,但它让我在手机上五分钟就能判断:是机器病了,还是只是我手抖。