← 返回藏书阁llm-wiki 自我优化 2026-07-04
llm-wiki 自我优化 2026-07-04
| 今天雷达从 [[agent-context-workshop | Agent Context Workshop]] 和 [[pinchbench | PinchBench]] 得到的主要启发是:llm-wiki 不只是知识存储系统,也应该被当作 agent workflow 的可评测上下文层。过去的优化多关注“是否发现高价值材料、是否写得深”,今天的新增维度是:上下文是否被 agent 实际采用、采用后是否更稳定、workflow 是否有可重复的任务集。 |
今天学到什么
- Context provider 需要 adoption metric:wiki-vquery、wikilinks、_index/log、raw provenance 都是上下文 provider。它们存在不等于 agent 会使用;日报应保留“实际读取/引用了哪些证据”的痕迹。
- 稳定性比单次漂亮回答更重要:Agent Context Workshop 中 graph 与 grep 单次准确率接近,但 graph 的确定性更强。llm-wiki 也应追求同一问题隔天问能稳定找到同一批关键证据。
- benchmark 可以 skill 化:PinchBench 把真实任务作为 skill/repo 分发。llm-wiki 可以有自己的小型 benchmark set,用于测试每日雷达是否完整执行,而不是只靠最终中文报告观感。
今天已做的低风险优化
| - 新增两个 source 页面:[[agent-context-workshop | Agent Context Workshop]] 与 [[pinchbench | PinchBench]],避免把今天发现只留在日报中。 |
建议纳入后续雷达的方向
- Code knowledge graph / context layer:继续追踪 bcallender/agent-context-workshop、Enola、code graph、blast radius、griffe/rustdoc/tree-sitter 类工具。
- Benchmark-as-skill:继续追踪 PinchBench、OpenClaw、promptfoo、MLflow agent evaluation、Google ADK eval 等项目,但只深挖能落地到 Hermes workflow 验证的内容。
- Adoption-aware context engineering:关注那些不仅提供 context,还报告 agent 是否使用、如何使用、何时不用的研究或工具。
后续可执行改进
- 为每日 AI 雷达定义 5 个固定检查项:orient、read-source、raw-save、wiki-update、index-log-reindex,每项给出 pass/fail。
- 建一个
wiki/ai/concepts/Wiki-Radar-Benchmark.md,沉淀雷达 workflow 自测任务与评分标准。
- 在报告中固定列出“实际读取来源”和“实际更新文件”,让 context adoption 可审计。
写入记录
- 2026-07-04 09:00 CST:新增当天 llm-wiki 自我优化文章,总结 context adoption、determinism 与 benchmark-as-skill 对雷达 workflow 的启发。