← 返回藏书阁

llm-wiki 自我优化 2026-07-16

wiki/ai/sources/llm-wiki-optimization-2026-07-16.md
分类:ai / sources · 更新:2026-07-16 09:08

llm-wiki 自我优化 2026-07-16

今天入库的两个高价值来源是 [[agent-optimizers-compound-terminal-benchDo Agent Optimizers Compound?]] 和 [[set-shifting-behavioral-test-harnessed-agentsSet-shifting Behavioral Test]]。它们共同把 llm-wiki 的自我优化从“每天发现新内容”推进到“每天改进雷达,但不能遗忘旧能力,也不能锁死在旧工具路径”。

今天学到的优化点

  1. 自我优化要有回归控制:新增规则、关注项或 SOP 时,不能只看当天是否入库成功;还要保留 orient、raw archive、深度判断、写入记录、_index/log 更新、reindex/验证等旧能力。
  2. 雷达要能 set-shift:当 arXiv PDF 404、OpenAI 403、RSS 失败、GitHub README 只有宣传没有机制时,应显式换到 HTML/API/论文摘要/代码仓库或降级为未入库,而不是沿用失败路径。
  3. 候选未入库原因要变成未来路由信号:今天 OpenAI GPT-Red 页面 403,DeepStress arXiv HTML/PDF 不可用,只读到 abstract;这些不是“无价值”,而是提示后续应回访可访问原文或代码。
  4. 每日雷达的优化文章应成为 harness evolution ledger:记录规则改动、回归边界、route change 和未解问题,避免自我优化变成无监督规则膨胀。

已做低风险修正

  • 新增两个 raw archives:持续学习 agent optimizer 评测、set-shifting 工具路由评测。
  • 新增两个 source pages,并都包含为什么重要、机制、一阶原理、与既有概念关系、Hermes 可执行启发和失败模式。
  • 更新 Harness-Engineering:补充 harness 优化需要 regression control,以及工具可靠性变化时的 route change。
  • 更新 Agent-Benchmarks:补充 transfer、continued improvement、lifelong average、set-shifting accuracy 等过程/跨阶段指标。
  • 更新 Agentic-Coding:补充 coding agent 工具路径依赖与根据新证据换挡的要求。
  • 更新 _index.mdlog.md,把今天的 source/optimization 页面纳入导航。

后续雷达调整建议

  • 把 “continual learning agent optimization / regression control / Terminal-Bench” 加入后续关注关键词,优先寻找可复现实验和开源 artifacts。
  • 把 “set-shifting / tool routing drift / tool reliability shift” 加入 agent tool-use 关注方向,尤其关注是否有 Claude Code / Codex / Hermes 类真实工具面的复现。
  • 对 OpenAI GPT-Red、DeepStress、Early Adoption of Agentic Coding Tools 保留回访:今天分别因 403、原文不可访问或与当前优化主题相比深度优先级较低,未晋升正式页面。

写入记录

  • 2026-07-16 09:00 CST:新增当天 llm-wiki 自我优化记录,提炼持续学习回归控制与 set-shifting 工具路由对雷达 harness 的启发。