TASK DETAIL · 观澜台
定时任务合理性与负载/死锁巡检
维护 Hermes 自身更新与本地补丁状态,降低工具链漂移风险。
异常 异常待处理归属:动力炉最近:3d 前频率:30 11 * * 1
需要关注
任务本身可能已运行,但投递到目标渠道失败。
下一步
检查投递目标、Feishu thread/channel 路由和消息格式,必要时改为观澜台沉淀。
这项任务在做什么
输入来源
Hermes repo/update 输出 本地补丁状态
运行逻辑
定期运行更新/检查流程并记录结果。
输出去向
更新日志 cron 输出
证据线索
/Users/zhengbokai/.hermes/cron/output/6a576cbb29e1/2026-09-14_11-37-16.md skill:hermes-agent
运行节奏
状态异常 delivery_failed最近运行2026-09-14T11:37:17.409160+08:00 · 3d 前下次运行2026-09-21T11:30:00+08:00投递方式origin · agent
最近输出
这里直接展示最近一段输出;完整机器可读数据保留在 report-bus.json,不放进人类阅读页。
错误摘要
live adapter send failed: [99992402] field validation failed; live adapter delivery to feishu:oc_c95dc33f3ab842d6406487e23ee50aaf failed: [99992402] field validation failed; delivery error: Feishu send failed: [99992402] field validation failed (target feishu:oc_c95dc33f3ab842d6406487e23ee50aaf)
live adapter send failed: [99992402] field validation failed; live adapter delivery to feishu:oc_c95dc33f3ab842d6406487e23ee50aaf failed: [99992402] field validation failed; delivery error: Feishu send failed: [99992402] field validation failed (target feishu:oc_c95dc33f3ab842d6406487e23ee50aaf)
2026-09-14T11:37:16.794246+08:00
,当前没有 pending;不是每分钟启动 agent。
- 扫码感知、cookie 刷新、RMS 共用 CDP `51074`,未见跨脚本共享互斥;扫码感知还会导航“第一个 page”,可能干扰登录或采集。
- 繁星阁任务 `a101e2378bae`(周一/四 18:00)也直接调用汇报总线脚本;调度器的**同 job 防重入不覆盖这种跨入口调用**。
- 最近24小时日志未见 `already running`、`Fire claim lost` 或明确死锁信号。
### 中|早间 agent 重叠,知识库可能读到半成品
- `83236dfdb31f` 今天实际运行 **09:00–09:29,29.65分钟、52次模型调用**。
- 与 `2c08fbba1510` 的 **09:00–09:09** 重叠。
- 又与 `0c49d4bb5faa` 的 **09:15–09:24** 重叠;两者都操作 `~/llm-wiki`,早报还会发布内容。
- 雷达期间多次出现 Firecrawl `403`,增加无效尝试。当前配置未显式设置 `cron.max_parallel_jobs`。
### 低|仓库更新失败、输出和锁文件
- **`c29f4708765b`|每日04:30|last_status=`error`**:今天检查30个仓库,其中 `youth/docker/cli_proxy_api/CLIProxyAPI` 连接 GitHub 443 超时,日志为 `75001 ms`;同时投递失败。脚本已有命令超时和锁,不像无限循环。
- Cron 目录约 **27.47 MiB / 1,234 文件**;最大单文件是历史 wiki-lint 输出,约1.14MB,暂无容量风险。
- 发现 **20 个零字节 lock 文件**,`lsof` 未见打开者。**不能按文件存在或 mtime 判死锁,也不建议直接删除。**
## 建议动作
1. **先修投递路径**:核验 `origin.thread_id` 到根消息 reply 的解析及现用 Feishu adapter;修复后用一条消息验证原 topic,再补发缺失报告,**不要重跑整套研究任务**。
2. **调整自动更新机制**:建议先暂停 `f85d82aa9345`,改为人工维护窗口;更新、补丁验证、重启和重启后验收分阶段留结果,避免由会被重启杀掉的 agent 自证成功。
3. **给高频脚本加硬边界**:CDP 单次等待设15–30秒,总执行设明确上限;ssh/scp/rsync 加执行超时,并确保超时清理子进程。
4. **加资源级互斥**:登录刷新共享一个非阻塞锁,保留原二维码会话、采集用独立 tab;注意父脚本调用刷新脚本时不要重复获取同一锁。汇报总线另设发布锁和临时输出目录。
5. **错开知识库任务**:早报移到雷达完成之后,例如10:00,并检查完成标记;weekly skill radar 移出09:00。可先把 cron 并发上限设为2,再观察脚本延迟。
6. **降低无效工作和噪音**:无变化跳过发布;扫码重发间隔按既定偏好改为10分钟;Firecrawl 遇确定性403立即换可用来源,不反复调用。
7. **保留失败事件而非只看 latest**:扫码恢复通知应保留待投递状态,送达后再确认;下次重点观察投递恢复、更新闭环、跨任务冲突及超时后的子进程残留。
**检查范围已完成,未修改任务、脚本、配置或重启服务。** 本次 `cronjob` 工具未开放,使用 `hermes cron list --all` 及原始记录替代;执行库普通只读连接失败后,已用不可变只读模式读取。账本仅保留09-13 16:11之后的记录,更早情况以上述日志为准。