llm-wiki 自我优化 2026-07-02
llm-wiki 自我优化 2026-07-02
今天从内容更新中学到什么
今天入库的两个来源分别推动 llm-wiki 的两个改进方向:
| 1. [[coda-bench | CODA-BENCH]] 提醒:agent 评测不能只看最终答案,还要看 discovery pipeline。真实任务常常失败在找错数据、漏读文件、没有隔离答案或没有执行验证。llm-wiki 的 query/ingest 也应显式记录“我从哪里发现证据”。 |
| 2. [[context-engineering-kit | Context Engineering Kit]] 提醒:上下文工程不能靠一个越来越长的总 prompt 解决。更好的方式是小粒度插件、按需加载、低 token footprint、标准化格式和 reflect/memorize 闭环。 |
今天已做的低风险优化
- 新增两个深度 source 页面:coda-bench 和 context-engineering-kit,都覆盖“为什么重要 / 机制 / 关系 / 可执行启发 / 失败模式 / 深度判断 / 写入记录”。
- 更新 Agent-Benchmarks:加入 CoDA-Bench 的数据密集型评测与 discovery accuracy 维度。
- 更新 Context-Engineering:加入上下文工程插件化、按需加载和 token footprint 的观察。
- 更新 External-Agent-Skills-Design-Patterns:加入“插件粒度与上下文预算”模式。
对 radar 的调整建议
- 后续 radar 关键词应继续扩大到:data-intensive agents、agent discovery accuracy、sandbox evaluation、context engineering kit、plugin granularity、skill package manager、prompt/skill lint。
- 对外部 skills/tools 候选,优先深挖能提供 schema、lint、eval、sandbox、标准化 package 或明确 workflow gate 的项目;单纯“超多技能合集”降权。
- 对 benchmark 候选,优先读 evaluation harness 与任务构造,而不是只看 leaderboard 数字。
后续建议
- 为 llm-wiki 设计一个小型 discovery 自测集:给定问题,要求 agent 在 vault 中定位相关 wiki/raw/log,并列证据路径后回答。
- 为 AI 雷达 cron 增加固定 QA 字段:
discovery checked、raw archived、pages linked、index/log updated、vector index status。 - 对 Hermes skills 逐步拆分:把长规则移入 references,把执行性步骤做成 scripts,把自动触发层保持短而强。
写入记录
- 2026-07-02 09:00 CST:新增当天自我优化文章,总结 CoDA-Bench 与 Context Engineering Kit 对 wiki discovery QA、benchmark 筛选和 skill 插件化的启发。