← 返回藏书阁

AgentBattler Bench — sealed harness benchmark for coding agents

wiki/ai/sources/agentbattler-bench-sealed-harness-benchmark.md
分类:ai / sources · 更新:2026-07-29 09:05

AgentBattler Bench — sealed harness benchmark for coding agents

为什么值得关注

AgentBattler Bench 是一个公开、可复现的 coding-agent harness benchmark,当前用自包含 JavaScript chess agents 和 terminal mini-ledger 系列任务比较 Claude Code、Codex CLI、Pi、DotAgents 等 harness/adapter。它特别强调 sealed schedule、container isolation、separate verifier、raw JSONL traces、snapshot hash、replay 和旧结果撤榜。这对 Agent-Benchmarks 中“harness 本身是变量”的观点提供了具体样本。

深度判断:值得晋升,因为它不只是新 benchmark,而是展示了 benchmark integrity 的自我修正:发现 native agent 能读到 holdout verifier 后撤回旧 ranking,并用 Harbor container + separate verifier rerun。这种“撤回不可信分数”的纪律比单纯排行榜更有长期价值。

机制 / 一阶原理

AgentBattler 的一阶原理是:如果 agent 能接触隐藏 verifier、答案或不该读取的 repo 文件,benchmark 分数就不再测真实能力。它通过 schedule-before-run、每个 runKey 原子持久化、infrastructure-invalid 标记、snapshot pointer、SHA-256 验证和 replay,把结果从“演示”提升为可审计实验。

任务设计也体现了 harness benchmark 的关键分离:challenge contract、adapter、model suite、verifier、published dataset、release snapshot 分层。这样即使某个 adapter 或运行环境失败,也不会被静默算成 agent loss/win。

与现有 wiki 概念的关系

  • Agent-Benchmarks:补充 sealed benchmark、isolation audit、撤榜、snapshot replay 的完整性机制。
  • Harness-Engineering:说明评测 harness 自身也需要安全边界和 verifier isolation。
  • halu-core-claim-grounded-agent-evaluation:二者都强调 evidence log,但 AgentBattler 更关注 benchmark 污染与复现。
  • Loop-Engineering:长期 benchmark loop 需要处理中断、无效运行、重复 replay 和发布证据。

对 Hermes / llm-wiki 的可执行启发

  1. 日报质量也应允许撤回/更正:如果后来发现来源读错或 raw/hash 不匹配,应在 log 中明确撤回或修订,而不是静默覆盖。
  2. 区分任务失败和基础设施失败:arXiv 429、GitHub rate limit、网页超时不应算作“内容无价值”,而应标记 blocked-by-access。
  3. 对新页面保留可复查证据:raw file + source page + log entry + reindex output 是 llm-wiki 的最小 snapshot。
  4. benchmark/评测类来源优先看完整性:是否有 hidden data isolation、replay、hash、transcript、无效运行处理。

失败模式 / 边界条件

  • 当前任务面较窄(chess/terminal ledger),不能直接代表所有 coding-agent 工作。
  • README 中很多结果和流程需要本地跑 npm/Docker 才能完全验证;今天只验证了公开 README 与 repo 元数据。
  • Harness benchmark 很容易被任务选择影响,应避免把单一 leaderboard 迁移为普遍结论。
  • 对用户实践的价值主要在 eval hygiene,而不是直接采用 chess task。

写入记录

  • 2026-07-29 09:00 CST:基于 README 深度入库,提炼其对 Hermes / llm-wiki / agentic workflow 的机制启发、边界条件和未安装原因。