← 返回藏书阁

TTHE — Test-Time Harness Evolution

wiki/ai/sources/tthe-test-time-harness-evolution.md
分类:ai / sources · 更新:2026-07-10 09:04

TTHE — Test-Time Harness Evolution

一句话结论

TTHE(Test-Time Harness Evolution)把 agent 的“可改进对象”从模型权重或单次 prompt,转移到围绕模型的可执行 harness:在测试/运行过程中读取未标注执行轨迹,让 proposer 生成候选 harness,由 judge 根据执行代理信号选择更好的 harness,并把被选中的控制程序持久化到后续输入。

为什么对用户重要

这篇论文值得深挖,因为它直接连接 Harness-EngineeringLoop-Engineering 和 Hermes cron/wiki radar 的实际痛点:无人循环每天都会产生轨迹、失败、候选来源、跳过原因和验证结果,但如果这些证据只进入当天报告,它们不会系统性改进下一次运行。TTHE 的启发是:长期 agent 系统的自我改进,不一定要训练模型;可以把执行轨迹变成 harness 修改建议,再用可审计 proxy gate 选择是否持久化。

对用户的 llm-wiki 来说,这意味着“每日雷达”不应只是发现内容,还应逐步演化自己的筛选规则、分类边界、索引结构、raw/source 晋升门槛和验证脚本。真正的改进对象是外层 workflow/harness,而不是一次回答的措辞。

机制 / 一阶原理

TTHE 的基本机制是:

  1. 把 harness 视为状态:agent 行为由模型 + context construction + tool policy + verifier + recovery logic 决定;其中可版本化、可审计、可修改的是 harness。
  2. 把测试轨迹视为无标签证据:每个任务都会产生模型调用、工具动作、中间输出、测试结果、runtime error、恢复决策等轨迹。这些轨迹不等于 gold label,但包含 harness 弱点信号。
  3. 角色分离:solver 执行任务,proposer 根据轨迹提出 harness 变体,judge 根据代理信号提交一个候选。它不是让同一个 agent 自说自话地“反思一下”,而是把执行、修改、选择拆成不同角色。
  4. 持久化改进:被选中的 harness 影响后续输入,因此系统学习的是可检查的控制程序,而非隐藏在上下文窗口里的临时经验。

一阶原理上,TTHE 把“test-time adaptation”从参数空间移动到程序空间:如果模型本身冻结,但控制程序可以改变,那么系统仍然能适应新分布、新工具、新 repo、新错误模式。这个方向尤其适合 Hermes,因为 Hermes 能写文件、维护 wiki、运行验证、记录 log,天然拥有“程序空间自我改进”的载体。

和已有 wiki 概念的关系

  • Harness-Engineering:TTHE 把 harness 从静态控制层推进为运行时可演化对象;harness 不只是 guardrail,也是学习/适应的状态。
  • Loop-Engineering:Loop 负责持续触发和验证;TTHE 提醒 loop 每轮产生的轨迹应反哺 workflow,而不是只作为一次性日志。
  • Agent-Benchmarks:TTHE 依赖 execution-derived proxy signals,这要求 benchmark 不只给最终 pass/fail,还要有能指导 harness 选择的中间信号。
  • AI-Self-Improvement-Lab:它提供了“无需改模型权重”的近端 self-improvement 路线:先改 harness、skills、context selectors、verifiers 和 recovery logic。

对 Hermes / llm-wiki 的可执行启发

  1. 每日 radar 应保留候选评分轨迹:不仅记录入库项,也记录为什么某些项未晋升。这些“负样本”可以帮助后续调整搜索 query 和晋升门槛。
  2. 把低风险规则直接固化:例如“抽象里出现 harness / context / coding agent 且能改变 Hermes 工作流”可以提高优先级;“只有产品宣传、无机制、无验证”的候选只留 digest。
  3. 让优化文章成为 harness evolution ledgerllm-wiki-optimization-YYYY-MM-DD.md 不只是总结,而应记录当天对雷达规则、索引结构、分类边界、验证方式的可持久化改动。
  4. 避免无监督自我强化:所有自动改规则都应有 proxy gate:是否减少重复、是否提高高价值命中率、是否降低薄页面数量、是否有真实验证输出。

失败模式 / 边界条件

  • proxy hacking:如果 judge 依据的代理信号很弱,harness 可能演化成“更会骗指标”而不是更可靠。
  • 轨迹污染:错误上下文、坏来源或工具异常可能被 proposer 当成普遍规律,导致错误规则持久化。
  • 过度演化:每天微调规则可能造成雷达漂移;需要周期性回看长期目标和用户偏好。
  • 不可复现:如果 harness 变体没有版本、diff、验证记录,就失去 TTHE 强调的 inspectability。

深度判断

本来源晋升为正式 source page,因为它提供了可复用方法论:把执行轨迹转化为可审计 harness 演化,而不是停留在“agent 反思”。它能直接改进 Hermes / llm-wiki 的 cron loop、自我优化文章和雷达评分机制。当前 confidence 设为 medium:已读取 arXiv 摘要和 PDF 前几页,但尚未复现实验或审查完整代码仓库。

写入记录

  • 2026-07-10 09:00 CST:新增 TTHE source page,提炼 test-time harness evolution 对 Hermes/llm-wiki 自我改进循环的启发。