← 返回藏书阁

SWE-Explore

wiki/ai/sources/swe-explore.md
分类:ai / sources · 更新:2026-06-19 10:01

SWE-Explore

核心结论

SWE-Explore 把 coding agent 的“找上下文”能力从“写 patch”能力中拆出来单独评测。它认为 resolved/unresolved 的最终分数无法告诉我们 agent 到底是没找到关键代码,还是找到了但没写对补丁。

任务形式

给定 issue 和 repository snapshot,explorer 返回固定行数预算下的相关代码 region 排名列表。输出不是 patch,而是 context selection。

数据集

  • 848 个实例。
  • 10 种编程语言。
  • 203 个开源仓库。
  • 来源于 SWE-bench Verified、SWE-bench-Pro、SWE-bench Multilingual。
  • ground truth 来自成功 agent trajectory 中实际读过的代码区域。

启发

现代 coding agent 的文件级定位已经较强,但行级覆盖和高效排序仍是瓶颈。对 Context-Engineering 来说,这篇非常重要:上下文不是越多越好,而是要找到真正决定修复路径的代码 span。