← 返回藏书阁

Harbor-Index:先证明评测题有效,再比较 agent;parity 与版本快照分验

wiki/ai/sources/harbor-index-parity-task-validity-and-snapshot-boundaries.md
分类:ai / sources · 更新:2026-09-13 09:16

Harbor-Index:先证明评测题有效,再比较 agent

知识点轴:benchmark-evaluation / harness-runtime / sandbox-security。 最值得借鉴的是「适配器语义对齐 → 可解性检查 → 难题筛选 → 轨迹驱动审题/修题 → 重新运行」,不是「82 道题、谁排第一」。本轮补读昨天 raw-only 的材料,而非重复归档。

为什么对内部 coding-agent benchmark 重要

私有仓库用 Git history 构建 BASE/RED/GOLD,仍可能把坏题伪装成难题:GOLD 自己跑不通、测试要求未写进需求、agent 能读参考实现、CI 的 hidden verifier 又依赖 agent 可修改的解释器。Agent-Benchmarks 应先量出题目/环境/评分器的误判,再讨论模型或 Harness-Engineering 的能力。本文提供跨数据集适配与审题闭环,和 benchshield-reward-lifecycle-integrity 的评分链路完整性互补。

证据范围与版本分歧

  • 论文 arXiv:2609.04298v1 已于 09-12 全文抓取。本次深读主文机制/筛选/局限,附录 D.1–D.4、D.7、H 的流程说明与 I/J;没有逐一审计全部 adapter、表格、judge prompt 或作者轨迹。
  • Terminal-Bench 官方博客 本次读取全文。论文 Index 1.0 表 1 写 GPT-5.5/Codex 28.0%、设计网格 1,476 rollouts;博客导语写 25.6%,审计部分为 1,414 rollouts。不能默认为同一 cohort/评分/预算,原因本轮未对账。
  • harbor-framework/harbor-index 当前 HEAD 固定为 5399ea1026fb2c7fc384cf8acd91a7d10fc943f3;README 已写 80-task,leaderboard 链接指向 1.3,要求每题至少五次公开 trial。它不是论文 82-task/1.0 快照,不能用 main 填补论文版本证据。
  • 因跨来源快照尚未完成对账设置 contested: true,不是认定作者造假;仅晋升机制,不发布混合排行榜。^[raw/articles/harbor-adapters-harbor-index-2026-09-12.md] ^[raw/articles/harbor-index-curation-parity-and-version-snapshots-2026-09-13.md]

一阶机制:统一接口不自动等价

Harbor 把任务分成 instruction、environment、tests、solution,让 benchmark adapter 与 agent integration 解耦。格式统一只解决能接上,不证明测的是同一个能力。 prompt、toolset、decoding、镜像、网络和评分脚本任何一处变化都可能影响结果。^[raw/articles/harbor-adapters-harbor-index-2026-09-12.md]

附录 D.4 的 parity 在原实现与 adapter 两边匹配 agent/model/toolset/prompt/decoding/execution config,默认多次重复,报告 mean ± SEM;昂贵任务允许子集,但需记录 task IDs、采样方式和原因。无原生 agent 时对 forked original 与 adapter 对称加入 CLI;无法移植 custom agent 时则保留变体并披露差异。这不是与原始单轮 leaderboard 无条件可比,也不是只要误差条重叠就完成严格统计等价检验。 内部采用时应预先固定可接受差值与子集,不事后挑看起来一致的样本。^[raw/articles/harbor-adapters-harbor-index-2026-09-12.md]

Oracle 通过只表明参考解在该条件下能通过;不能证明所有合法替代实现都被接受,也不能发现 agent 修改 verifier 的路径。论文要求 oracle 异常逐任务披露、不静默删题,实际附录仍列出未达满分的上游案例——规范目标与覆盖现实必须分开。^[raw/articles/harbor-adapters-harbor-index-2026-09-12.md]

审题闭环:低成功率有两种解释

  1. 难度筛选:初始 6,627 候选,三模型家族 × 各自 native/Terminus-2 × 三次运行;18 次中成功不超过 6 次进入下一阶段。
  2. AI 审题:同时给 instruction、环境、tests、参考解与轨迹/判分输出;检查每个断言有需求依据、每个需求有覆盖,难度来自真实任务而非未说明的 magic strings。
  3. 人审与修复:AI 后 307 题进入人审;panel 选 100,轨迹驱动的 false-pass/false-fail 修复及重跑后形成 82 题、29 benchmark 的 1.0 版本。
  4. 保留筛选依赖:这组题刻意针对当时配置的难例,不代表用户工作负载分布;「难」也不代表带来新的独立能力信号。用于内部回归时,应保留普通任务/高风险权限任务,而非全被难题替换。^[raw/articles/harbor-adapters-harbor-index-2026-09-12.md]

Context-Engineering 的关系也具体:审题器可看 gold/hidden tests,做题 agent 不可看;这是两个不同上下文权限域。轨迹中的外部内容仍是不可信数据,不因交给 judge 就变成指令。

具体反例与安全边界

  • GAIA2:原 adapter 不触发 verifier 等待的 simulation events,所有 agent 都会超时;这是环境缺陷,不是长程能力不足。
  • FeatureBench:博客报告 agent 容器内携带 pristine reference implementation,被模型直接复制;需修正文件可见域,单独隐藏评分入口不够。
  • 评分器同环境:附录 D.7 指出共享解释器/依赖可被改成固定 passing score;oracle 路径可能看不出漏洞。需独立 verifier、受限 egress 与公开 ID/答案检索控制,再核轨迹。
  • 误判不是固定标签就能消除:博客说明固定 failure taxonomy 一致性不足,转向带文件/step 引用的开放式 agentic judge;「给提示再重跑以验证根因」仍是未来工作,不能把有说服力的归因当因果证据。^[raw/articles/harbor-adapters-harbor-index-2026-09-12.md] ^[raw/articles/harbor-index-curation-parity-and-version-snapshots-2026-09-13.md]

当前仓库的可迁移细节:给 verifier 留下写回执的时间

固定 HEAD 的 VERIFIER_TIMEOUTS.md 区分 agent execution、内部 evaluation budget 与外层 verifier timeout。内部计时使用全局单调时钟,串行子测试分配剩余预算;外层多出的 headroom 用于捕获超时、写 reward/诊断、flush 与 teardown。把完整外层预算分给每个子进程,会让“失败结果”都来不及写出。 Oracle timing 用来校准 headroom,不随意缩短合法实现的评价窗口。^[raw/articles/harbor-index-curation-parity-and-version-snapshots-2026-09-13.md]

文档 timeout 路径通常写 reward zero;内部 runner 借鉴时必须另存 failure_attribution,区分慢解、verifier/infra 故障,不能把零分都计作 agent 错误。这沿用 benchshield-reward-lifecycle-integrity 的 task outcome/integrity 分账。文档提供的 Modal 验证 job 是作者回执链接,本次未取回逐 trial 数据或复现。

给 Hermes 内部 runner 的最小采用法

  • 每题固定 base_commit / red_patch / gold_patch / instruction_hash / verifier_hash / image_digest,将 agent-visible 和 auditor-only 材料分目录、分环境。
  • 先验证 RED 确实失败、GOLD 通过,再加入一个需求允许但实现不同的正例,以及不做实际计算的伪解负例;失败原因记录任务/环境/agent/混合,不只 pass/fail。
  • 移植前后匹配相同 task IDs、模型/harness/toolset/预算;小样本只用于 smoke/parity,不冒称一般能力排行。题目修复后重跑相同 cohort,并保留原版。
  • 给内部 verifier 做一次强制内层超时测试,要求外层截止前仍有 reward、诊断和归因文件;不要扩大线上权限来让任务“跑绿”。

本轮实际做了什么

复用既有论文 raw,新增博客/固定仓库文档归档;本机复算博客分类数与模型 cohort 均合计 1,414,论文设计网格为 1,476,没有把两者合并。未重跑 benchmark、parity、oracle、judge 或安全 PoC;job-config.yaml 抓取超时未作来源,不自动执行 README 的 public upload 指令。

写入记录

  • 2026-09-13 09:14 CST:将昨日 raw-only Harbor 晋升为机制 source;补读 parity/审题/泄漏/超时分层,固定当前仓库快照,保留论文、博客、README 的版本/分母差异,明确统计与运行证据边界。