← 返回藏书阁

Do Agent Optimizers Compound? — Terminal-Bench 2.0 持续学习评测

wiki/ai/sources/agent-optimizers-compound-terminal-bench.md
分类:ai / sources · 更新:2026-07-16 09:09

Do Agent Optimizers Compound? — Terminal-Bench 2.0 持续学习评测

这篇论文的问题很直接:agent harness / prompt / tool / memory 优化方法在一个固定 benchmark 上提升后,收益能否在后续新任务中继续复利?作者用 Terminal-Bench 2.0 hard tasks 构造两阶段持续学习评测,对比 GEPA、Meta Harness 和 RELAI-VCL。结论不是“优化一定有效”,而是:静态单阶段分数会高估真实部署价值;只有把 regression control 放进优化循环,收益才更可能在新任务到来后继续累积。

为什么对用户重要

Hermes / llm-wiki 的每日雷达、本地 skills、工作流规则和 wiki 页面模板,本质上也是可优化的 harness。过去几周的 wiki 已经沉淀了 [[tthe-test-time-harness-evolutionTTHE]]、[[evosop-iterative-tool-optimizationEvoSOP]]、Harness-Engineering 等方向,但一个未解决问题是:每天把规则变复杂,究竟是在复利,还是在对昨天的任务过拟合?

这篇论文值得入库,因为它把“自我改进”从一次性提分改成持续评测问题:新规则不仅要提升当前任务,还要在新任务到来时保持旧能力,并能继续改进。对用户来说,这直接影响 Hermes cron、llm-wiki ingest、coding-agent workflow 和 skills 生命周期:任何持久化的优化都应附带回归集、负样本和长期平均表现,而不是只看当天输出是否漂亮。

机制 / 一阶原理

论文的核心机制是两阶段评测:先在 Phase 1 任务上优化 agent harness,再引入 Phase 2 新任务,观察优化后的 harness 是否迁移;随后在旧+新混合任务上继续给第二轮优化预算,观察收益是否继续增加而不遗忘旧任务。

一阶原理是:harness optimization 是一个搜索过程,而搜索过程如果只看当前目标,很容易找到 shortcut solution。比如更激进的 prompt、工具使用习惯或输出格式可能让当前任务过关,却损害未知任务或旧任务。Regression control 的作用不是事后报告“有没有退化”,而是在候选选择时就把退化当成硬约束或强惩罚,让优化器偏向能跨阶段保留能力的解。

论文报告的摘要结果是:三种方法在静态单阶段设置下都优于 baseline;但新任务出现后分化明显。GEPA 的优化 agent 在迁移时低于未优化 baseline,Meta Harness 能迁移但第二轮无法继续提升,RELAI-VCL 同时做到正迁移和后续继续提升,并达到最高 lifelong average pass rate(论文摘要给出 76.4%,对比 GEPA 66.0%、Meta Harness 64.6%、baseline 58.7%)。这支持一个实用判断:是否把回归控制内置到优化循环,是 agent 优化能否复利的关键变量

和既有 wiki 概念的关系

  • Harness-Engineering:它给“harness 可演化”增加了反面约束:可演化不等于每天堆规则;没有 regression control 的 harness evolution 可能退化成 benchmark overfitting。
  • Agent-Benchmarks:它提醒 benchmark 不应只报告单阶段 pass rate,而应报告 transfer、continued improvement、lifelong average 和旧任务回归。
  • AI-Self-Improvement-Lab:它给近端 self-improvement 一条更稳路线:优化 prompts/tools/memory/control code 时,把回归集和新任务流作为学习环境。
  • Loop-Engineering:长期 loop 应有“新任务进入 → 继续优化 → 检查旧能力”的生命周期,而不是每轮独立调参。

对 Hermes / llm-wiki 的可执行启发

  1. 每日雷达规则要有回归集:例如 orient、raw 保存、写入记录、_index/log 更新、深度判断、未入库原因,这些是旧能力,不能为了追新源而牺牲。
  2. 低风险自我优化也要记录旧能力影响:今天新增“持续学习/回归控制”关注项后,后续优化文章应明确它是否减少重复、薄页面或误入库,而不是只记录新建议。
  3. skills / SOP 晋升要做 phased evaluation:一个新 SOP 先在近期任务上有效还不够,应在旧任务样本、新任务样本和混合任务上看是否稳定。
  4. 对 coding agent 任务报告 lifelong metric:除了“本次是否修好”,还应关注该 workflow 是否保留了安全边界、验证习惯和 context discipline。

边界与失败模式

论文使用 Terminal-Bench 2.0 hard tasks,任务之间可能仍比真实生产任务更相近;结果不能直接外推到所有 agent。RELAI-VCL 的优势也需要更多开源复现和不同模型/工具面的验证。对 Hermes 来说,最大的误用是把它理解成“要自动优化更多规则”;正确理解应是:只有能通过回归控制和长期平均表现验证的规则,才值得持久化。

深度判断

晋升为正式 source page,因为它直接回答 llm-wiki 近期自我优化链条中的核心问题:agent/harness 优化是否真的复利,以及如何避免对固定 benchmark 或当天任务过拟合。它有明确机制、实验对比和对 Hermes workflow 的可迁移约束。当前 confidence: medium:已读取 arXiv HTML 全文重点段落和摘要结果,但尚未运行其 GitHub artifacts 或独立复现实验。

写入记录

  • 2026-07-16 09:00 CST:新增 Terminal-Bench 2.0 agent optimizer 持续学习评测来源页,提炼 regression control、transfer、continued improvement 与 llm-wiki 自我优化回归集的关系。