Do Agent Optimizers Compound? — Terminal-Bench 2.0 持续学习评测
Do Agent Optimizers Compound? — Terminal-Bench 2.0 持续学习评测
这篇论文的问题很直接:agent harness / prompt / tool / memory 优化方法在一个固定 benchmark 上提升后,收益能否在后续新任务中继续复利?作者用 Terminal-Bench 2.0 hard tasks 构造两阶段持续学习评测,对比 GEPA、Meta Harness 和 RELAI-VCL。结论不是“优化一定有效”,而是:静态单阶段分数会高估真实部署价值;只有把 regression control 放进优化循环,收益才更可能在新任务到来后继续累积。
为什么对用户重要
| Hermes / llm-wiki 的每日雷达、本地 skills、工作流规则和 wiki 页面模板,本质上也是可优化的 harness。过去几周的 wiki 已经沉淀了 [[tthe-test-time-harness-evolution | TTHE]]、[[evosop-iterative-tool-optimization | EvoSOP]]、Harness-Engineering 等方向,但一个未解决问题是:每天把规则变复杂,究竟是在复利,还是在对昨天的任务过拟合? |
这篇论文值得入库,因为它把“自我改进”从一次性提分改成持续评测问题:新规则不仅要提升当前任务,还要在新任务到来时保持旧能力,并能继续改进。对用户来说,这直接影响 Hermes cron、llm-wiki ingest、coding-agent workflow 和 skills 生命周期:任何持久化的优化都应附带回归集、负样本和长期平均表现,而不是只看当天输出是否漂亮。
机制 / 一阶原理
论文的核心机制是两阶段评测:先在 Phase 1 任务上优化 agent harness,再引入 Phase 2 新任务,观察优化后的 harness 是否迁移;随后在旧+新混合任务上继续给第二轮优化预算,观察收益是否继续增加而不遗忘旧任务。
一阶原理是:harness optimization 是一个搜索过程,而搜索过程如果只看当前目标,很容易找到 shortcut solution。比如更激进的 prompt、工具使用习惯或输出格式可能让当前任务过关,却损害未知任务或旧任务。Regression control 的作用不是事后报告“有没有退化”,而是在候选选择时就把退化当成硬约束或强惩罚,让优化器偏向能跨阶段保留能力的解。
论文报告的摘要结果是:三种方法在静态单阶段设置下都优于 baseline;但新任务出现后分化明显。GEPA 的优化 agent 在迁移时低于未优化 baseline,Meta Harness 能迁移但第二轮无法继续提升,RELAI-VCL 同时做到正迁移和后续继续提升,并达到最高 lifelong average pass rate(论文摘要给出 76.4%,对比 GEPA 66.0%、Meta Harness 64.6%、baseline 58.7%)。这支持一个实用判断:是否把回归控制内置到优化循环,是 agent 优化能否复利的关键变量。
和既有 wiki 概念的关系
- 对 Harness-Engineering:它给“harness 可演化”增加了反面约束:可演化不等于每天堆规则;没有 regression control 的 harness evolution 可能退化成 benchmark overfitting。
- 对 Agent-Benchmarks:它提醒 benchmark 不应只报告单阶段 pass rate,而应报告 transfer、continued improvement、lifelong average 和旧任务回归。
- 对 AI-Self-Improvement-Lab:它给近端 self-improvement 一条更稳路线:优化 prompts/tools/memory/control code 时,把回归集和新任务流作为学习环境。
- 对 Loop-Engineering:长期 loop 应有“新任务进入 → 继续优化 → 检查旧能力”的生命周期,而不是每轮独立调参。
对 Hermes / llm-wiki 的可执行启发
- 每日雷达规则要有回归集:例如 orient、raw 保存、写入记录、_index/log 更新、深度判断、未入库原因,这些是旧能力,不能为了追新源而牺牲。
- 低风险自我优化也要记录旧能力影响:今天新增“持续学习/回归控制”关注项后,后续优化文章应明确它是否减少重复、薄页面或误入库,而不是只记录新建议。
- skills / SOP 晋升要做 phased evaluation:一个新 SOP 先在近期任务上有效还不够,应在旧任务样本、新任务样本和混合任务上看是否稳定。
- 对 coding agent 任务报告 lifelong metric:除了“本次是否修好”,还应关注该 workflow 是否保留了安全边界、验证习惯和 context discipline。
边界与失败模式
论文使用 Terminal-Bench 2.0 hard tasks,任务之间可能仍比真实生产任务更相近;结果不能直接外推到所有 agent。RELAI-VCL 的优势也需要更多开源复现和不同模型/工具面的验证。对 Hermes 来说,最大的误用是把它理解成“要自动优化更多规则”;正确理解应是:只有能通过回归控制和长期平均表现验证的规则,才值得持久化。
深度判断
晋升为正式 source page,因为它直接回答 llm-wiki 近期自我优化链条中的核心问题:agent/harness 优化是否真的复利,以及如何避免对固定 benchmark 或当天任务过拟合。它有明确机制、实验对比和对 Hermes workflow 的可迁移约束。当前 confidence: medium:已读取 arXiv HTML 全文重点段落和摘要结果,但尚未运行其 GitHub artifacts 或独立复现实验。
写入记录
- 2026-07-16 09:00 CST:新增 Terminal-Bench 2.0 agent optimizer 持续学习评测来源页,提炼 regression control、transfer、continued improvement 与 llm-wiki 自我优化回归集的关系。