TASK DETAIL · 观澜台
告警守望10分钟健康检查(Agent全量判断)
检查告警守望采集链路和告警摘要,避免把采集失败误判为 0 告警。
停用/完成 需要关注归属:观澜台最近:30d 前频率:every 10m
需要关注
需要关注
下一步
已停用/完成;如无后续价值,可在动力炉中标记归档,避免干扰日常判断。
这项任务在做什么
输入来源
OPD/AMC 告警源 watchdog state 健康检查脚本输出
运行逻辑
采集告警与健康信号,由 Agent 判断采集链路、噪音和高价值问题。
输出去向
本地状态文件 巡检摘要 必要时飞书/企微提醒
证据线索
/Users/zhengbokai/.hermes/cron/output/fa4fc55658ae/2026-07-04_07-45-33.md alert_watchdog_healthcheck.sh skill:remote-service-admin-triage
运行节奏
状态停用/完成 ok最近运行2026-07-04T07:45:34.206034+08:00 · 30d 前下次运行2026-07-04T07:55:34.206034+08:00投递方式origin · agent
最近输出
这里直接展示最近一段输出;完整机器可读数据保留在 report-bus.json,不放进人类阅读页。
2026-07-04T07:45:33.571339+08:00
failed: class=SOURCE_UNAVAILABLE, last_error=Command '['/opt/homebrew/bin/python3.12', '/Users/zhengbokai/alert_inspection_local/opd-tools-src/aboszheng/opd-tools/scripts/opd_reader.py', 'amc-alerts', '--pages', '10', '--rows', '100', '--output-limit', '1000']' timed out after 160 seconds
时间:2026-07-04T07:42:39+08:00
```
你是告警守望健康检查 Agent。目标:每 10 分钟读取健康检查脚本快照,判断告警守望采集链路、登录态、状态文件、cron 输出和路由机制是否健康。
脚本输出说明:scheduler 会先运行 `alert_watchdog_healthcheck.sh`,该脚本会检查告警守望相关状态和健康信号。
必须遵守:
1. 如果健康检查显示正常且无新增高价值问题,输出低噪、简短摘要。
2. 如果出现 AUTH_EXPIRED、UNKNOWN、collector stale、SSO 过期、状态长时间不更新、脚本失败等情况,要明确标为“巡检系统自身故障”。
3. 不要把采集失败解释为“0 告警”。
4. 不要逐条转发原始告警;重点说明影响、证据、建议动作。
5. 企微只用于确认 P0、巡检系统自身故障或持续升级;普通告警不要直推企微。
输出要求:中文,先结论;固定结构尽量简短:`结论` / `异常` / `建议动作`。
## Response
## 结论
**巡检系统自身故障,需要处理。**
本次不是“0 告警”,而是告警守望采集链路不可用:健康检查脚本退出码 `1`,collector 已 stale,且 AMC 采集命令超时。
## 异常
- **collector state stale**:最后成功时间 `2026-07-04 02:22:31 +08:00`,截至 `07:42:39` 已约 **320 分钟未成功更新**。
- **collector failed / SOURCE_UNAVAILABLE**:执行 AMC 采集命令超时:
- `/opt/homebrew/bin/python3.12 .../scripts/opd_reader.py amc-alerts --pages 10 --rows 100 --output-limit 1000`
- 超时时间:`160s`
- 我额外检查到本地 `watchdog_state/state.json` 存在,但主状态内容更新时间仍显示为 `2026-06-29T13:29:23+08:00`,说明至少有一份长期状态快照未持续更新,不能作为当前告警面判断依据。
## 建议动作
1. **先按巡检链路故障处理**:检查 `opd_reader.py amc-alerts` 是否卡在 AMC/OPD 登录态、SSO、页面加载或接口超时;不要把当前采集失败解读为告警清零。
2. **验证登录态与采集命令**:手动运行同一条 `opd_reader.py amc-alerts`,优先看是否出现 SSO 过期、页面初始化失败、接口 401/403/超时。
3. **修复 stale 监控阈值/状态写入**:确认 collector 成功后是否更新最新 state/snapshot;若仍只更新旧 `watchdog_state/state.json` 或未写入健康检查读取的状态文件,需要修正状态文件路径或写入逻辑。