评估 AGENTS.md:仓库级上下文文件是否真的有用
评估 AGENTS.md:仓库级上下文文件是否真的有用
这篇 arXiv 论文是对 AGENTS.md 快速流行的一次必要校准:它不默认相信 repository-level context files 有用,而是直接问它们是否真的能帮助 coding agents 完成任务。评估覆盖两类场景:带有 LLM-generated context files 的 SWE-bench 风格任务,以及本身已有 developer-committed context files 的真实仓库 issue。
对 wiki 的意义
这篇论文把 Context-Engineering 从经验判断变成可评估假设。如果 repo-level context files 只在某些条件下有效,团队就应该衡量 instruction quality、relevance 和 drift,而不是简单堆更长的文件。
实践 takeaway
把 AGENTS.md 当成 tests 或 docs 来维护:短、准、贴近仓库,并定期用真实 agent runs 验证。