← 返回藏书阁

SRE-Bench:隐藏判分、污染控制与可判分覆盖率

wiki/ai/sources/sre-bench-hidden-grader-and-coverage.md
分类:ai / sources · 更新:2026-09-16 09:27

SRE-Bench:隐藏判分、污染控制与可判分覆盖率

结论与价值

知识点轴:benchmark-evaluation / harness-runtime / context management / sandbox-security(测量边界)。 这里SRE指逆向工程,不是站点可靠性工程。最值得迁移到用户内部coding-agent评测的,不是模型排行榜,而是私有任务构造、真实规模、不可见判分、反作弊审计,以及拒绝/上下文溢出单独记账

本文基于 arXiv:2608.11469 的完整HTML、官方项目页与原表格。模型名/成绩属于作者快照,非本机跑分,也不据此给出当前通用模型排名。

一阶机制:先控制题目来源,再控制反馈

作者从私有设计规格独立构建19个程序,跨语言与领域,在编译/保护条件上生成262个二进制实例;每个实例有六项确定性判分任务,构成1,572项任务。程序、实例、rubric子任务、模型run是不同统计单位,不能统称“测试数”。

它强调:公开项目只改局部代码仍可能保留可识别的架构,模型可以靠记忆捷径而非真正分析得分;但新写的玩具程序也不代表真实工程难度。其私有真实规模目标、小型clean-room目标、公开衍生目标的消融提供了调查路径,不是已经排除全部训练污染的独立证明

作者报告统一mini-SWE-agent harness、唯一bash工具、最高reasoning设置、每run最多500模型步/六小时。执行容器提供目标和分析工具,但移除grader、reference solutions、开发材料;运行中不给评分反馈。领域判分利用独立状态/输出验证,并通过对抗reward-hacking审计修补无须真实分析的得分捷径。

对于 Agent-Benchmarks:hidden verifier并非单纯“把测试目录藏起来”,还要确认agent可见文件、反馈时机、评分材料、reference与最终状态的关系。harbor-index-parity-task-validity-and-snapshot-boundaries 的oracle与伪解审查可补上判分器本身出错的风险。

关键口径:拒绝与context溢出被排除

论文表4明确:只有返回gradeable结果的实例参与所有均值;其余主要为网络安全理由拒绝或超出上下文窗口,后者集中于grok-4.5。这是选择性分母,不能把其余run当作成功或无成本消失。

下表由原表数值用Python复算,未重跑模型;“全计划成功比例”是本轮补充口径,只把有证据完全成功的实例计入分子,不主张所有未判分均为能力失败。

作者模型标签计划实例可判分完全成功成功/可判分成功/全计划可判分覆盖率
gpt-5.6-sol2622548031.50%30.53%96.95%
claude-opus-52622563212.50%12.21%97.71%
gpt-5.5262262103.82%3.82%100.00%
grok-4.526221820.92%0.76%83.21%
glm-5.226226200.00%0.00%100.00%

作者最强模型的61.4%指平均rubric分数归一化,不是61.4%的实例完全完成;31.5%则是80/254,不是80/262。表中五组计划run合计1,310,可判分1,252;不等于1,572项rubric任务的数量。

拒绝是否合理,须另设授权/任务安全标签;上下文溢出则属于 Context-Engineering 与harness失败。两者不能统一包装成“安全成功”,也不能未经区分都算模型不会。该benchmark未提供sandbox breakout防御率或security-adjusted success,不能拿二进制分析成绩替代容器/工具安全评估

对内部coding-agent benchmark的迁移

  • 私有构造与泄露审计:以私有repo/Git history构造BASE/RED/GOLD时,隐藏GOLD、测试补丁、验收说明和CI旁路;记录repo/commit/构建依赖hash。私有身份不保证依赖或模板未被模型见过。
  • 题目有效性:先oracle通过,再负例挑战,接受合法替代实现;把表面完成但独立状态不符、读取hidden test等行为单独计分。
  • 运行manifest:固定harness commit、模型/配置、context与步数/时间预算、可见工具/数据、grader版本、重试/重复次数、轨迹与费用。不要只保存最终答案或“通过”。
  • 分母并列:planned / started / gradeable / solved,与refusal / context overflow / infra error / timeout分列;所有run的成本和结束原因都留账,展示条件分数与交付覆盖率。

这些是迁移建议,今天未建立私有任务池或运行用户线上仓库。参考 benchshield-reward-lifecycle-integrity 的弃权口径,不再引入新receipt名词。

本轮证据及未解问题

完整论文归档包含构造、表4、消融和附录;Python解析原HTML table并复算实例/任务组合与分母。保存 sre.htmlsre-tables.json、取证脚本/结果/hash。不执行二进制、攻击工具或模型实验。

本轮未取得并验证可公开下载的一整套固定runner、全部私有任务和逐run回执;官方页指向榜单不等于这些材料已齐全。不能宣称独立复现、校验作者全部费用或重复试验的稳定性。下一步优先找作者run manifest/拒绝与溢出分解,而不是追排行榜更新。

写入记录

  • 2026-09-16 09:19 CST:新增私有构造、隐藏判分与反作弊机制;按原表复算可判分/全计划分母,区分拒绝、context失败与sandbox安全。
  • 2026-09-16 09:26 CST:按实际文件创建时间校正首次写入记录。