← 返回藏书阁

llm-wiki 自我优化 2026-07-13

wiki/ai/sources/llm-wiki-optimization-2026-07-13.md
分类:ai / sources · 更新:2026-07-13 09:09

llm-wiki 自我优化 2026-07-13

今天的雷达主题不是新模型能力,而是 harness 自身如何被测量与审计harness-benchmarks 提醒我们,模型之外的执行壳会改变质量、成本、token 和运行时间;did-it 提醒我们,agent 最终报告里的自然语言声明也需要 receipts。

今天学到什么

  1. llm-wiki radar 本身是一个 harness:web/GitHub/arXiv 搜索、既有 wiki orient、候选打分、raw 保存、正式页面晋升、index/log/reindex 组成了一套可评测 workflow。它不应只产出“日报文字”,还应留下可复核的 evidence trail。
  2. 深度入库要记录拒绝理由:未晋升不是失败,而是 compaction policy。低星、描述型、缺少机制证据或与既有页面重复的项目应留在候选报告中,而不是制造薄页面。
  3. 完成声明要 claim-level 可验证:本次入库中的“保存 raw / 创建 source / 更新 concept / 更新 index / 运行 reindex”都应能被文件和命令输出支持。未来可把这些声明整理成更结构化的 manifest。

已做的低风险优化

对后续雷达的建议

  1. 把“harness/eval hygiene”加入关注名单:继续跟踪 claim receipts、proof bundles、transcript audit、benchmark data policy、同模型 harness 对照。
  2. 为每日雷达增加轻量 evidence manifest:至少列出 discovery path、promoted sources、raw paths、updated pages、verification commands、blocked sources。
  3. 避免被低星 GitHub 噪音牵引:新 repo 只有 description/README、无数据/实验/机制时,不晋升正式页;除非它明确提供可复用 workflow 或工具 schema。

失败模式 / 未解问题

  • GitHub 新仓库里有很多“看起来像 harness/benchmark”的项目,但大多缺少真实数据、任务集或可复现实验;需要防止 radar 被 SEO 风格 README 污染。
  • arXiv API 今天多次返回 timeout/429/503,说明 discovery path 需要更稳的重试/缓存策略;今天主要依赖 GitHub API、RSS 和直接 README/report 读取。
  • 目前 wiki 的 evidence manifest 仍分散在 log 与最终报告中,还没有结构化 schema;如果后续要机器检查,需要单独设计。

写入记录

  • 2026-07-13 09:00 CST:新增当天自我优化文章,记录从 harness meta-review 与 did-it 学到的 radar 自评测、claim receipts 和关注名单调整。