llm-wiki 自我优化 2026-07-25
llm-wiki 自我优化 2026-07-25
今天从内容更新中学到什么
今天入库的 OpenBench、Preloop、Omnigent 都指向同一个趋势:agent workflow 的竞争点正在从“单次 prompt 写得好不好”转向 harness 是否可测、control plane 是否可治理、meta-harness 是否可互操作。
对 llm-wiki 来说,这意味着每日 AI radar 不应只追踪新 repo,也应把自身当作一个可评估 harness:是否完成 orient、是否读原文、是否保存 raw+hash、是否避免重复、是否写深度页面、是否更新 _index.md / log.md、是否重建向量索引、是否报告未入库原因。
今天实际优化了什么
- 将 OpenBench、Preloop、Omnigent 分别作为 source 页面入库,而不是只放在候选 digest 中,因为它们分别覆盖 benchmark、control plane、meta-harness 三个可复用方法论层。
- 在相关 concept 页面中补充“harness-as-variable / control plane / meta-harness”的概念关系,避免把三类工具混为一个“agent 框架”。
- 当 GitHub API 触发 rate limit 后,改用 raw.githubusercontent.com 直接读取 README;这符合 radar 的 route-change 原则:发现层失败不应中断原文验证。
对 radar 关注名单的调整建议
低风险调整:未来几天的搜索主题应临时扩大到三组关键词:
coding-agent harness benchmark/private coding agent eval/transcripts checkerAI agent control plane/MCP firewall/agent approvals/runtime auditmeta-harness/multi-agent operator console/agent sandbox orchestration
高风险/需人工确认:是否要把 Preloop/Omnigent 真实安装到本机或 Hermes runtime。它们会改写 agent 配置或引入新的控制面,不应由无人 cron 自动执行。
未解问题
- OpenBench 的任务集是否足够代表用户真实 coding workflow?需要以后用私有/本地任务复验。
- Preloop 的 Hermes 插件是否成熟、是否兼容当前 Hermes profile 与 cron 运行方式?需要人工确认后再测试。
- Omnigent alpha 阶段的 meta-harness 复杂度是否值得引入?短期更适合作为架构参考,而不是生产依赖。
写入记录
- 2026-07-25 09:00 CST:新增当天优化文章,总结 harness benchmark、agent control plane、meta-harness 对 llm-wiki radar 自评和关注名单扩展的启发。