SWE-Explore
SWE-Explore
核心结论
SWE-Explore 把 coding agent 的“找上下文”能力从“写 patch”能力中拆出来单独评测。它认为 resolved/unresolved 的最终分数无法告诉我们 agent 到底是没找到关键代码,还是找到了但没写对补丁。
任务形式
给定 issue 和 repository snapshot,explorer 返回固定行数预算下的相关代码 region 排名列表。输出不是 patch,而是 context selection。
数据集
- 848 个实例。
- 10 种编程语言。
- 203 个开源仓库。
- 来源于 SWE-bench Verified、SWE-bench-Pro、SWE-bench Multilingual。
- ground truth 来自成功 agent trajectory 中实际读过的代码区域。
启发
现代 coding agent 的文件级定位已经较强,但行级覆盖和高效排序仍是瓶颈。对 Context-Engineering 来说,这篇非常重要:上下文不是越多越好,而是要找到真正决定修复路径的代码 span。