← 返回藏书阁

llm-wiki 自我优化 2026-07-25

wiki/ai/sources/llm-wiki-optimization-2026-07-25.md
分类:ai / sources · 更新:2026-07-25 09:08

llm-wiki 自我优化 2026-07-25

今天从内容更新中学到什么

今天入库的 OpenBench、Preloop、Omnigent 都指向同一个趋势:agent workflow 的竞争点正在从“单次 prompt 写得好不好”转向 harness 是否可测、control plane 是否可治理、meta-harness 是否可互操作

对 llm-wiki 来说,这意味着每日 AI radar 不应只追踪新 repo,也应把自身当作一个可评估 harness:是否完成 orient、是否读原文、是否保存 raw+hash、是否避免重复、是否写深度页面、是否更新 _index.md / log.md、是否重建向量索引、是否报告未入库原因。

今天实际优化了什么

  • 将 OpenBench、Preloop、Omnigent 分别作为 source 页面入库,而不是只放在候选 digest 中,因为它们分别覆盖 benchmark、control plane、meta-harness 三个可复用方法论层。
  • 在相关 concept 页面中补充“harness-as-variable / control plane / meta-harness”的概念关系,避免把三类工具混为一个“agent 框架”。
  • 当 GitHub API 触发 rate limit 后,改用 raw.githubusercontent.com 直接读取 README;这符合 radar 的 route-change 原则:发现层失败不应中断原文验证。

对 radar 关注名单的调整建议

低风险调整:未来几天的搜索主题应临时扩大到三组关键词:

  1. coding-agent harness benchmark / private coding agent eval / transcripts checker
  2. AI agent control plane / MCP firewall / agent approvals / runtime audit
  3. meta-harness / multi-agent operator console / agent sandbox orchestration

高风险/需人工确认:是否要把 Preloop/Omnigent 真实安装到本机或 Hermes runtime。它们会改写 agent 配置或引入新的控制面,不应由无人 cron 自动执行。

未解问题

  • OpenBench 的任务集是否足够代表用户真实 coding workflow?需要以后用私有/本地任务复验。
  • Preloop 的 Hermes 插件是否成熟、是否兼容当前 Hermes profile 与 cron 运行方式?需要人工确认后再测试。
  • Omnigent alpha 阶段的 meta-harness 复杂度是否值得引入?短期更适合作为架构参考,而不是生产依赖。

写入记录

  • 2026-07-25 09:00 CST:新增当天优化文章,总结 harness benchmark、agent control plane、meta-harness 对 llm-wiki radar 自评和关注名单扩展的启发。