监控
应同时监控进程、依赖、主机和录制结果。容器处于运行状态,并不能证明数据库已就绪、输出卷可写,或平台能够正常录制。
健康接口
| 接口 | 认证 | 用途 |
|---|---|---|
GET /api/health/live | 公开 | 进程存活与运行时间;Docker 健康检查使用该接口 |
GET /api/health/ready | 启用认证时需要 Bearer 令牌 | 根据组件状态返回 200 ready 或 503 not ready |
GET /api/health | 启用认证时需要 Bearer 令牌 | 版本、运行时间、组件状态、CPU 和内存使用率 |
存活检查用于重启死亡进程;带认证的就绪检查用于停止向异常实例发送任务并告警。保护监控令牌,并只向监控网络开放所需访问。
bash
curl http://localhost:12555/api/health/live
curl http://localhost:12555/api/health/ready \
-H "Authorization: Bearer <access-token>"没有 /metrics 接口。请抓取上面的 JSON 健康接口,或在应用之外采集。
日志
bash
docker compose logs --since=30m rust-srec
docker compose logs --since=30m frontend示例 Compose 会轮转容器 JSON 日志,应用也会向 LOG_DIR 写入日志。事件历史需要跨主机故障保留时,应集中采集日志;即使应用已隐藏凭据,路径和平台元数据仍可能敏感,因此要限制访问。
最小告警集
- 后端存活失败或循环重启。
- 超过预期启动时间后,就绪检查持续非 200。
- 输出卷剩余空间或 inode 数越过警告/严重阈值。
- 输出根不可写。
- 单个平台或多个平台的录制/分片失败增加。
- 管道排队时间、失败率或 CPU/IO 饱和度增加。
- 凭据过期或平台认证开始失败。
- 备份年龄或恢复验证间隔超过政策。
严重告警应至少配置两条路径,避免唯一通知服务本身故障时失联。
运行审查
定期查看系统健康、会话、管道任务和通知事件页面。除了基础设施,还要检查业务结果变化:频道始终离线、反复产生极短分片或输出空文件,都可能发生在进程仍健康时。