TASK DETAIL · 观澜台

告警守望10分钟健康检查(Agent全量判断)

检查告警守望采集链路和告警摘要,避免把采集失败误判为 0 告警。

停用/完成 需要关注归属:观澜台最近:30d 前频率:every 10m

需要关注

需要关注

下一步

已停用/完成;如无后续价值,可在动力炉中标记归档,避免干扰日常判断。

这项任务在做什么

输入来源

OPD/AMC 告警源 watchdog state 健康检查脚本输出

运行逻辑

采集告警与健康信号,由 Agent 判断采集链路、噪音和高价值问题。

输出去向

本地状态文件 巡检摘要 必要时飞书/企微提醒

证据线索

/Users/zhengbokai/.hermes/cron/output/fa4fc55658ae/2026-07-04_07-45-33.md alert_watchdog_healthcheck.sh skill:remote-service-admin-triage

运行节奏

状态停用/完成 ok最近运行2026-07-04T07:45:34.206034+08:00 · 30d 前下次运行2026-07-04T07:55:34.206034+08:00投递方式origin · agent

最近输出

这里直接展示最近一段输出;完整机器可读数据保留在 report-bus.json,不放进人类阅读页。

2026-07-04T07:45:33.571339+08:00

failed: class=SOURCE_UNAVAILABLE, last_error=Command '['/opt/homebrew/bin/python3.12', '/Users/zhengbokai/alert_inspection_local/opd-tools-src/aboszheng/opd-tools/scripts/opd_reader.py', 'amc-alerts', '--pages', '10', '--rows', '100', '--output-limit', '1000']' timed out after 160 seconds 时间:2026-07-04T07:42:39+08:00 ``` 你是告警守望健康检查 Agent。目标:每 10 分钟读取健康检查脚本快照,判断告警守望采集链路、登录态、状态文件、cron 输出和路由机制是否健康。 脚本输出说明:scheduler 会先运行 `alert_watchdog_healthcheck.sh`,该脚本会检查告警守望相关状态和健康信号。 必须遵守: 1. 如果健康检查显示正常且无新增高价值问题,输出低噪、简短摘要。 2. 如果出现 AUTH_EXPIRED、UNKNOWN、collector stale、SSO 过期、状态长时间不更新、脚本失败等情况,要明确标为“巡检系统自身故障”。 3. 不要把采集失败解释为“0 告警”。 4. 不要逐条转发原始告警;重点说明影响、证据、建议动作。 5. 企微只用于确认 P0、巡检系统自身故障或持续升级;普通告警不要直推企微。 输出要求:中文,先结论;固定结构尽量简短:`结论` / `异常` / `建议动作`。 ## Response ## 结论 **巡检系统自身故障,需要处理。** 本次不是“0 告警”,而是告警守望采集链路不可用:健康检查脚本退出码 `1`,collector 已 stale,且 AMC 采集命令超时。 ## 异常 - **collector state stale**:最后成功时间 `2026-07-04 02:22:31 +08:00`,截至 `07:42:39` 已约 **320 分钟未成功更新**。 - **collector failed / SOURCE_UNAVAILABLE**:执行 AMC 采集命令超时: - `/opt/homebrew/bin/python3.12 .../scripts/opd_reader.py amc-alerts --pages 10 --rows 100 --output-limit 1000` - 超时时间:`160s` - 我额外检查到本地 `watchdog_state/state.json` 存在,但主状态内容更新时间仍显示为 `2026-06-29T13:29:23+08:00`,说明至少有一份长期状态快照未持续更新,不能作为当前告警面判断依据。 ## 建议动作 1. **先按巡检链路故障处理**:检查 `opd_reader.py amc-alerts` 是否卡在 AMC/OPD 登录态、SSO、页面加载或接口超时;不要把当前采集失败解读为告警清零。 2. **验证登录态与采集命令**:手动运行同一条 `opd_reader.py amc-alerts`,优先看是否出现 SSO 过期、页面初始化失败、接口 401/403/超时。 3. **修复 stale 监控阈值/状态写入**:确认 collector 成功后是否更新最新 state/snapshot;若仍只更新旧 `watchdog_state/state.json` 或未写入健康检查读取的状态文件,需要修正状态文件路径或写入逻辑。