← 返回藏书阁

llm-wiki 自我优化 2026-07-04

wiki/ai/sources/llm-wiki-optimization-2026-07-04.md
分类:ai / sources · 更新:2026-07-04 09:06

llm-wiki 自我优化 2026-07-04

今天雷达从 [[agent-context-workshopAgent Context Workshop]] 和 [[pinchbenchPinchBench]] 得到的主要启发是:llm-wiki 不只是知识存储系统,也应该被当作 agent workflow 的可评测上下文层。过去的优化多关注“是否发现高价值材料、是否写得深”,今天的新增维度是:上下文是否被 agent 实际采用、采用后是否更稳定、workflow 是否有可重复的任务集。

今天学到什么

  1. Context provider 需要 adoption metric:wiki-vquery、wikilinks、_index/log、raw provenance 都是上下文 provider。它们存在不等于 agent 会使用;日报应保留“实际读取/引用了哪些证据”的痕迹。
  2. 稳定性比单次漂亮回答更重要:Agent Context Workshop 中 graph 与 grep 单次准确率接近,但 graph 的确定性更强。llm-wiki 也应追求同一问题隔天问能稳定找到同一批关键证据。
  3. benchmark 可以 skill 化:PinchBench 把真实任务作为 skill/repo 分发。llm-wiki 可以有自己的小型 benchmark set,用于测试每日雷达是否完整执行,而不是只靠最终中文报告观感。

今天已做的低风险优化

  • Context-Engineering 补充为“上下文内容 + 加载策略 + adoption/determinism/token efficiency 评测”的组合。
  • Agent-Benchmarks 补充为不仅测公开任务 pass rate,也测 workflow adoption、determinism、真实桌面任务和 benchmark-as-skill。
  • Repository-Exploration 补充为从 grep/search 走向 graph traversal、blast radius、关系证据链。
- 新增两个 source 页面:[[agent-context-workshopAgent Context Workshop]] 与 [[pinchbenchPinchBench]],避免把今天发现只留在日报中。

建议纳入后续雷达的方向

  • Code knowledge graph / context layer:继续追踪 bcallender/agent-context-workshop、Enola、code graph、blast radius、griffe/rustdoc/tree-sitter 类工具。
  • Benchmark-as-skill:继续追踪 PinchBench、OpenClaw、promptfoo、MLflow agent evaluation、Google ADK eval 等项目,但只深挖能落地到 Hermes workflow 验证的内容。
  • Adoption-aware context engineering:关注那些不仅提供 context,还报告 agent 是否使用、如何使用、何时不用的研究或工具。

后续可执行改进

  1. 为每日 AI 雷达定义 5 个固定检查项:orient、read-source、raw-save、wiki-update、index-log-reindex,每项给出 pass/fail。
  2. 建一个 wiki/ai/concepts/Wiki-Radar-Benchmark.md,沉淀雷达 workflow 自测任务与评分标准。
  3. 在报告中固定列出“实际读取来源”和“实际更新文件”,让 context adoption 可审计。

写入记录

  • 2026-07-04 09:00 CST:新增当天 llm-wiki 自我优化文章,总结 context adoption、determinism 与 benchmark-as-skill 对雷达 workflow 的启发。