DeepSWE — Measuring Frontier Coding Agents on Original, Long-Horizon Engineering Tasks
DeepSWE — 原创长程 Coding Agent Benchmark
一句话结论
DeepSWE 把 coding-agent 评测从“复现公开 GitHub 历史修复”推向“原创、长程、功能级验证”的任务集:113 个任务覆盖 91 个活跃开源仓库和五种语言,任务不回流上游,参考解不进入公开训练语料,评分由手写 verifier 检查功能而非继承 PR 测试。
为什么对用户重要
这篇值得深挖,因为它直接修正了 Agent-Benchmarks 和 AI-Code-Review 里反复出现的两个痛点:公开 benchmark 容易被训练集污染,且测试常常只验证某个历史 patch,而不验证“任意正确实现”。对用户维护 Hermes / llm-wiki 的启发是:真正有价值的 agent benchmark 不应只问“是否改到能过现成测试”,而要问任务是否新鲜、是否长程、是否有功能级 verifier、是否释放完整 trajectory 供复盘。
对日常 agentic coding 来说,DeepSWE 也提醒我们:如果一个 coding agent 在熟悉 benchmark 上很强,不代表它能在新的仓库、新的任务说明和新的隐藏 verifier 下稳定工作。Hermes 的代码任务报告因此应更强调“原创规格 + 独立验证 + 轨迹证据”,而不是只引用公开 leaderboard。
机制 / 一阶原理
DeepSWE 的核心机制包括:
- 原创任务设计:任务从头编写,而不是从 GitHub merged PR 挖掘,降低模型在预训练中见过 issue、discussion、patch 或测试的可能性。
- 长程真实仓库操作:任务跨 91 个活跃仓库,参考解触及的代码量显著高于常见 SWE-bench 风格任务,更接近真实维护工作。
- 功能级 verifier:评分器检查用户请求的功能是否成立,并接受不同实现路径;这比“运行历史 PR 的测试”更适合评估开放式解决方案。
- 轨迹公开:释放完整 evaluation trajectories,使研究者能分析 agent 是如何探索、误判、验证或跳过验证的。
一阶原理上,DeepSWE 把评测目标从“拟合历史修复分布”转为“在新问题上形成可验证工程行为”。这与 Harness-Engineering 的方向一致:评分器、sandbox、trace 和 task construction 是 benchmark 的控制层,不只是附属数据。
和已有 wiki 概念的关系
- 对 Agent-Benchmarks:补充“原创性 / contamination resistance / functional verifier / trajectory release”四个评测维度。
- 对 AI-Code-Review:支持“先审规格,再审代码;功能级 verifier 优于只看现有测试”的 review membrane。
- 对 Repository-Exploration:DeepSWE 的长程仓库任务可以检验 agent 是否真的找到相关代码路径,而不是靠短 prompt 猜测。
- 对 Harness-Engineering:benchmark harness 自身决定评测质量;继承测试与手写 verifier 的差异就是 harness 质量差异。
对 Hermes / llm-wiki 的可执行启发
- coding-agent 结论要标注污染风险:引用 benchmark 时优先说明任务是否原创、是否公开历史 fix 挖掘、是否可能被训练见过。
- 本地任务也要写 functional verifier:Hermes 做代码修改时,应尽量补充独立验证脚本或行为检查,而不是只跑现成单测。
- 保留轨迹摘要:长程失败不能只记录最终失败;应记录探索路径、错误假设、验证跳过点和修复尝试,供后续 Loop-Engineering 改进。
- 雷达晋升门槛提高:只发布 leaderboard 分数的材料不够;能改进 task construction / verifier / trace analysis 的 benchmark 更值得入库。
失败模式 / 边界条件
- 手写 verifier 也可能有盲点:功能级 verifier 比继承测试更好,但仍可能漏掉副作用、性能、安全和集成约束。
- 任务规模仍有限:113 个任务可以拉开 frontier agent,但未必覆盖所有真实企业代码形态。
- 原创性会随时间衰减:benchmark 公开后会进入训练语料,长期需要版本化更新或保留隐藏集。
- trajectory 公开的隐私/污染张力:公开轨迹便于研究,但也会让未来模型学习 benchmark 策略。
深度判断
晋升为正式 source page,因为 DeepSWE 不只是“又一个 coding benchmark”,而是给出可迁移的评测设计原则:原创任务、功能级 verifier、污染控制和轨迹审计。这能直接改进 Hermes 对 coding agent、wiki ingest 乃至自动化 workflow 的评测方式。当前 confidence 设为 medium:本次读取了 arXiv 摘要页和元数据,尚未完整复现实验或审查 benchmark 仓库。
写入记录
- 2026-07-11 09:00 CST:新增 DeepSWE source page,提炼其对原创长程 coding-agent benchmark、功能级 verifier 和轨迹审计的启发。