← 返回藏书阁

llm-wiki 自我优化 2026-07-12

wiki/ai/sources/llm-wiki-optimization-2026-07-12.md
分类:ai / sources · 更新:2026-07-12 09:04

llm-wiki 自我优化 2026-07-12

今天从内容更新中学到什么

今天入库的两项内容共同指向一个问题:agent 系统的质量不只取决于模型能力,而取决于“能力是否被正确诊断、正确加载、正确验证”。[[uniclawbench-proactive-agent-benchmarkUniClawBench]] 提醒我们把失败拆成 skill usage、exploration、long-context、multimodal、cross-platform;[[ratel-context-engineering-tool-selectionRatel]] 提醒我们不要把所有工具/技能都常驻上下文,而应按需检索和调用。

已做的低风险优化

  1. Agent-Benchmarks 中补充 proactive agent 的能力驱动评测维度,避免把未来桌面/多工具任务统一归成“agent 不行”。
  2. Context-Engineering 中补充 tool/skill context footprint,把工具 schema、skill manifest 和按需加载纳入上下文工程。
  3. Harness-Engineering 中补充 closed-loop benchmark harness 与 capability router 的关系,为后续 Hermes cron 复盘提供结构化维度。

对雷达本身的调整建议

  • 未来候选评分应显式记录“它改善哪一类 agent 能力”:工具使用、探索、长上下文、多模态、跨平台、安全控制、验证膜或上下文预算。
  • 对工具类 repo,不应只看 star 数;要看它是否给出可复用机制、benchmark、失败模式和可迁移接口。Ratel 虽然 star 不高,但机制与用户 skill 生态高度相关,因此值得入库。
  • 对 benchmark 论文,应优先选择能反哺 Hermes workflow 的方法论,而不是只新增 leaderboard。

未做/需谨慎的优化

  • 暂未把 Ratel 直接接入 Hermes;这属于运行时架构改动,需先做小实验:对比“全量 skill 上下文”与“检索式 skill manifest”的任务成功率、token、漏召率。
  • 暂未建立完整 capability manifest;建议先从 llm-wiki skill、Hermes coding workflow、AI radar cron 三个高频场景试点。

写入记录

  • 2026-07-12 09:00 CST:新增当天自我优化文章,记录 UniClawBench 与 Ratel 对 radar harness、能力诊断和 skill/context 加载策略的启发。