SRE-Bench:隐藏判分、污染控制与可判分覆盖率
SRE-Bench:隐藏判分、污染控制与可判分覆盖率
结论与价值
知识点轴:benchmark-evaluation / harness-runtime / context management / sandbox-security(测量边界)。 这里SRE指逆向工程,不是站点可靠性工程。最值得迁移到用户内部coding-agent评测的,不是模型排行榜,而是私有任务构造、真实规模、不可见判分、反作弊审计,以及拒绝/上下文溢出单独记账。
本文基于 arXiv:2608.11469 的完整HTML、官方项目页与原表格。模型名/成绩属于作者快照,非本机跑分,也不据此给出当前通用模型排名。
一阶机制:先控制题目来源,再控制反馈
作者从私有设计规格独立构建19个程序,跨语言与领域,在编译/保护条件上生成262个二进制实例;每个实例有六项确定性判分任务,构成1,572项任务。程序、实例、rubric子任务、模型run是不同统计单位,不能统称“测试数”。
它强调:公开项目只改局部代码仍可能保留可识别的架构,模型可以靠记忆捷径而非真正分析得分;但新写的玩具程序也不代表真实工程难度。其私有真实规模目标、小型clean-room目标、公开衍生目标的消融提供了调查路径,不是已经排除全部训练污染的独立证明。
作者报告统一mini-SWE-agent harness、唯一bash工具、最高reasoning设置、每run最多500模型步/六小时。执行容器提供目标和分析工具,但移除grader、reference solutions、开发材料;运行中不给评分反馈。领域判分利用独立状态/输出验证,并通过对抗reward-hacking审计修补无须真实分析的得分捷径。
对于 Agent-Benchmarks:hidden verifier并非单纯“把测试目录藏起来”,还要确认agent可见文件、反馈时机、评分材料、reference与最终状态的关系。harbor-index-parity-task-validity-and-snapshot-boundaries 的oracle与伪解审查可补上判分器本身出错的风险。
关键口径:拒绝与context溢出被排除
论文表4明确:只有返回gradeable结果的实例参与所有均值;其余主要为网络安全理由拒绝或超出上下文窗口,后者集中于grok-4.5。这是选择性分母,不能把其余run当作成功或无成本消失。
下表由原表数值用Python复算,未重跑模型;“全计划成功比例”是本轮补充口径,只把有证据完全成功的实例计入分子,不主张所有未判分均为能力失败。
| 作者模型标签 | 计划实例 | 可判分 | 完全成功 | 成功/可判分 | 成功/全计划 | 可判分覆盖率 |
| gpt-5.6-sol | 262 | 254 | 80 | 31.50% | 30.53% | 96.95% |
| claude-opus-5 | 262 | 256 | 32 | 12.50% | 12.21% | 97.71% |
| gpt-5.5 | 262 | 262 | 10 | 3.82% | 3.82% | 100.00% |
| grok-4.5 | 262 | 218 | 2 | 0.92% | 0.76% | 83.21% |
| glm-5.2 | 262 | 262 | 0 | 0.00% | 0.00% | 100.00% |
作者最强模型的61.4%指平均rubric分数归一化,不是61.4%的实例完全完成;31.5%则是80/254,不是80/262。表中五组计划run合计1,310,可判分1,252;不等于1,572项rubric任务的数量。
拒绝是否合理,须另设授权/任务安全标签;上下文溢出则属于 Context-Engineering 与harness失败。两者不能统一包装成“安全成功”,也不能未经区分都算模型不会。该benchmark未提供sandbox breakout防御率或security-adjusted success,不能拿二进制分析成绩替代容器/工具安全评估。
对内部coding-agent benchmark的迁移
- 私有构造与泄露审计:以私有repo/Git history构造BASE/RED/GOLD时,隐藏GOLD、测试补丁、验收说明和CI旁路;记录repo/commit/构建依赖hash。私有身份不保证依赖或模板未被模型见过。
- 题目有效性:先oracle通过,再负例挑战,接受合法替代实现;把表面完成但独立状态不符、读取hidden test等行为单独计分。
- 运行manifest:固定harness commit、模型/配置、context与步数/时间预算、可见工具/数据、grader版本、重试/重复次数、轨迹与费用。不要只保存最终答案或“通过”。
- 分母并列:planned / started / gradeable / solved,与refusal / context overflow / infra error / timeout分列;所有run的成本和结束原因都留账,展示条件分数与交付覆盖率。
这些是迁移建议,今天未建立私有任务池或运行用户线上仓库。参考 benchshield-reward-lifecycle-integrity 的弃权口径,不再引入新receipt名词。
本轮证据及未解问题
完整论文归档包含构造、表4、消融和附录;Python解析原HTML table并复算实例/任务组合与分母。保存 sre.html、sre-tables.json、取证脚本/结果/hash。不执行二进制、攻击工具或模型实验。
本轮未取得并验证可公开下载的一整套固定runner、全部私有任务和逐run回执;官方页指向榜单不等于这些材料已齐全。不能宣称独立复现、校验作者全部费用或重复试验的稳定性。下一步优先找作者run manifest/拒绝与溢出分解,而不是追排行榜更新。
写入记录
- 2026-09-16 09:19 CST:新增私有构造、隐藏判分与反作弊机制;按原表复算可判分/全计划分母,区分拒绝、context失败与sandbox安全。
- 2026-09-16 09:26 CST:按实际文件创建时间校正首次写入记录。