llm-wiki 自我优化 2026-07-07
llm-wiki 自我优化 2026-07-07
今日内容更新带来的元启发
今天深挖的三条材料共同指向一个主题:llm-wiki 不只是“知识沉淀库”,也应该是 agent workflow 的控制与评测对象。
| - [[dscc-compositional-agent-policies | DSCC]] 提醒:安全边界应跟随工具链和数据流,而不是只绑定单个工具。wiki radar 的发现、raw 保存、正式页面晋升、index/log 更新、reindex 和交付报告是一条组合链,链条中每一步都可能放大前一步的错误或未验证材料。 |
| - [[underspecbench-action-boundary | UnderSpecBench]] 提醒:在无人 cron 场景中,遇到目标或范围不明确时不能向用户澄清,因此默认应降级为保守动作,例如只读发现、raw 留存、标注 medium/low confidence,而不是猜测并写入长期事实。 |
| - [[greplica-persistent-coding-agent-memory | Greplica]] 提醒:持久记忆必须能证明自己减少重复探索和改善计划质量。llm-wiki 的 _index、wikilinks、raw provenance、wiki-vquery、ConversationSpec 都应被看作 context provider,并接受 adoption / determinism / token-efficiency / answer-quality 的评估。 |
今天已做的低风险优化
- 更新 Harness 控制面:在 Harness-Engineering 中补充“组合式工具策略与行动边界”,把 DSCC 与 UnderSpecBench 转化为 Hermes 自动任务门禁:目标明确、目录明确、影响半径受控、未验证上下文不外传。
- 更新 benchmark 维度:在 Agent-Benchmarks 中补充 action-boundary 与 context-provider benchmark,避免只看 completion score。
- 更新 context engineering 定义:在 Context-Engineering 中补充 persistent memory 的 held-out planning benchmark 视角,强调上下文系统要证明自己 load-bearing。
- 更新 repository exploration 路线:在 Repository-Exploration 中补充从重复 grep/read 转向持久工程记忆查询的路线。
- raw/source 分层:三条高价值材料均保存 raw,并只将具有方法论深度和 Hermes 可迁移价值的内容晋升为正式 source page。
对后续雷达的调整建议
1. 增加“agent control layer”专题轮换
后续 web/arXiv/GitHub 搜索应定期覆盖:MCP execution control、multi-tool policy composition、data-flow authorization、taint tracking、agent governance、action-boundary benchmarks。原因是 Hermes 的风险越来越来自工具链组合,而不是单个 prompt 失败。
2. 增加“persistent memory / context provider evaluation”专题轮换
关注 Greplica、ContextEcho、Token Warden、Dao Code、repository memory、prompt-cache economics、ConversationSpec-like artifacts。重点不是工具是否热门,而是它们是否提供可评测的上下文收益:减少 tokens、tool calls、时间、重复探索,并提升计划/答案质量。
3. 为 llm-wiki radar 自身建立轻量 benchmark
可以先从最小指标开始:
- orient 是否完成:是否读取 _index 与近期 log;
- source evidence:是否保存 raw 与 sha256;
- promotion gate:是否说明为什么晋升/不晋升;
- link health:新页面是否至少有 2 个有效 wikilinks;
- rediscovery reduction:新页面是否写出未来可复用的机制、失败模式和可执行启发。
暂未执行的较大改动
- 没有直接修改 cron prompt 或 wiki-vquery 代码;这类改动会影响每日自动化行为,建议先单独审查。
- 没有引入新的全局 tag taxonomy;当前 vault 缺少 SCHEMA.md,继续沿用既有标签风格,避免大规模重构。
- 没有把 GitHub 搜索中出现的所有项目入库;Token Warden、ContextEcho、Dao Code、Blue Spec 等更适合作为后续候选,需读到更完整 README/论文或看到更强 evidence 后再晋升。
写入记录
- 2026-07-07 09:00 CST:记录今日 AI 雷达对 llm-wiki 的自我优化启发:组合式工具安全、行动边界评测、持久记忆 context-provider 评测,以及已完成的低风险页面更新。