Agentic Coding
Agentic Coding
Agentic Coding 是让 AI agent 在代码仓库中自主规划、读取、编辑、测试和迭代的软件开发模式。它区别于传统补全工具:不是只给下一行代码,而是能围绕一个目标执行多步工作。
人机分工
Anthropic 的 Claude Code 使用研究显示,典型分工是:人类负责“做什么”,agent 负责“怎么做”。这并不意味着人类 expertise 变得不重要;相反,越懂业务和系统的人,越能给出高质量目标、上下文和验收标准,让 agent 做更多正确工作。
关键能力
- 目标分解:把需求拆成可执行步骤。
- 仓库探索:找到相关文件、函数和代码行。
- 补丁生成:根据上下文实现修改。
- 验证循环:运行测试、解释失败、继续修复。
- 风险控制:限制修改范围、保留审查和回滚机制。
瓶颈
SWE-Explore 提醒我们,coding agent 失败不一定是不会写代码,常常是没有找到正确上下文。未来 coding agent 的核心竞争点会从“能写代码”转向“能否高效探索复杂仓库并定位关键证据”。
相关
- Harness-Engineering 提供约束和反馈系统。
- Context-Engineering 决定 agent 能否读到关键上下文。
- Agentic-Engineering 是把 agentic coding 扩展到多 agent、多任务、可验证工程流程后的工作形态.
2026-07-01 补充:No verdict = not done
| [[agentops-coding-agent-verification | AgentOps coding-agent verification membrane]] 给 Agentic-Coding 增加了一个明确完成定义:代码修改只是候选结果,只有通过独立检查、真实测试或明确 gate 并留下 verdict,才算完成。 |
这比“让 agent 自己运行测试”更强,因为它强调验证者与生成者分离。实践中可以用另一个模型、固定测试、lint、review rubric 或 human approval 组成混合验证层,降低 agent 自信但错误的风险。
2026-07-05 补充:高吞吐 agentic coding 的瓶颈迁移
| [[lovable-scaling-agentic-coding | Lovable 的高 token agentic coding 复盘]]显示,当 agent 产能足够高时,瓶颈从“能不能写代码”迁移到“人类注意力如何分配、变更如何风险分层、PR 如何保持可审查、知识如何在组织内扩散”。小 PR / stacked PR、local review-and-fix、CI safety net、markdown policy + deterministic enforcement 是一套可迁移机制。 |
这对 Hermes 的启发是:agentic coding 的成功不应按生成量衡量,而应按 outcome、验证证据、风险路由和可复用 workflow 衡量。
2026-07-13 补充:完成声明必须与证据对齐
| [[did-it-claim-evidence-reconciliation | did-it]] 把 Agentic-Coding 的验证循环推进到最终报告层:agent 声称“测试通过”“文件已创建”“迁移已跑完”,必须能被 transcript 或重新执行证据支持。否则只能标记为 unsupported,而不是默认相信。 |
这对 Hermes 的实践含义是:最终回复应尽量把“写了什么、运行了什么、验证输出是什么、哪些声明没有证据”分开。尤其在无人 cron 和自动发布任务中,claim receipts 可以降低“看起来完成但实际未验证”的风险。
2026-07-14 补充:agentic coding 的工具面和仓库 genome
| [[execute-code-tool-surface-ablation | execute_code 工具面限制实验]] 说明 coding agent 的表现不是模型单变量,而是 task regime、agent design 与 tool surface 的交互结果。对计算型任务,窄 code execution 可能降低成本;对真实仓库修改,过窄工具面可能提高编辑/探索摩擦。 |
| [[aigx-context-format | AIGX]] 则从另一侧减少摩擦:通过仓库 genome 和 per-file boundary index,让 agent 更快知道哪些文件受哪些规则约束。[[seta-scaling-environments-terminal-agents | SETA]] 进一步说明,如果要训练或评估这种能力,需要可执行 terminal 环境和 post-rollout verifier,而不是只看最终 patch。 |
2026-07-15 补充:先问后修,把仓库知识缺口显式化
| [[acquire-qa-driven-repository-knowledge | ACQUIRE]] 给 Agentic-Coding 增加了一个关键前置阶段:在 patch loop 之前,由 Questioner 生成机制/行为、设计/用法、位置/结构、生态/标准四类问题,再由 Answerer 只读探索仓库并形成 evidence-grounded QA,最后 Resolver 才生成补丁。 |
这补充了“仓库探索”能力的定义:好的 coding agent 不只是会 grep/read/edit/test,而是能先说清楚自己缺什么仓库知识,并把答案绑定到证据。对 Hermes 来说,复杂代码任务默认应从 knowledge-gap checklist 开始;如果问题无法回答,应 HOLD 或继续只读探索,而不是带着模糊上下文直接修改。
2026-07-16 补充:工具使用要能摆脱路径依赖
| [[set-shifting-behavioral-test-harnessed-agents | Set-shifting Behavioral Test]] 把 agentic coding 中常见但不易量化的问题显式化:agent 可能在几轮成功后锁定某个工具 routine,即使可靠工具或任务阶段已经变化。真实仓库中,这表现为反复 grep 同一关键词、坚持低信号测试、沿用旧错误假设、或在专用读写工具足够时仍扩大到 shell。 |
对 Hermes 来说,agentic coding 的工具策略应从“会用工具”升级为“能根据新证据换挡”:当搜索结果没有命中,应改变查询维度;当测试失败信息指向新模块,应回到只读探索;当工具或权限边界变化,应记录 route change 和原因。否则验证循环可能只是惯性循环。
2026-07-17 补充:高吞吐 coding agent 需要安全债务和跨会话规则治理
| [[security-debt-autonomous-coding-agents | Autonomous Coding Agents 的 Security Debt]] 显示,agent-generated PR 的风险并不限于功能错误:在 4,022 个 PR 的样本中,38.9% 至少包含一个 security smell,供应链完整性问题占绝大多数 smells,critical smells 几乎都集中在 hard-coded credentials。更重要的是,人类协作者也会在 AI 加速工作流中引入真实泄漏 secret,说明人机协作界面本身会改变警觉性。 |
| [[self-improving-coding-agents-behavioral-rules | Self-Improving Coding Agents Through Behavioral Rules]] 则提供了减少同类错误复发的方法:把被接受的 review feedback 转成持久行为规则、自查 checklist 和验证机制。对 Hermes 来说,复杂代码任务不应只追求一次完成,而应把失败类别转成可审查、可去重、可评估的规则,并在未来任务中检查是否复发。 |
2026-07-21 补充:从直接 patch 到 artifact-governed coding
| [[flow-next-agentic-engineering-workflow | Flow-Next]] 与 [[fastcontext-read-only-repository-exploration | FastContext]] 共同提示:高质量 agentic coding 不应从“让主 agent 直接探索并 patch”开始,而应先把意图变成 spec/task artifacts,把仓库探索委托给只读 cited explorer,再让 fresh worker 在明确上下文中实现,并由不同模型/工具面 review。 |
这把 Agentic Coding 的工作单元从单次聊天推进到可交接 workflow:探索答案、任务切片、实现、测试、review 和 receipt 都是可复查对象。对 Hermes 来说,复杂代码任务应默认区分 read-only evidence acquisition 与 write-phase implementation;如果只读阶段无法给出足够 citation,应 HOLD 或继续探索,而不是扩大修改范围。
2026-08-03 补充:agent as function 与 guarded starter kit
ultracodex 把 agentic coding 从“一个宿主里的对话”推进到“可编程 agent function”:workflow、loop、scheduler、org 可以跨 Codex、Claude、OpenCode 后端组合。claude-starter-kit 则从反方向提醒:一旦 coding agent 进入真实 repo,关键规则必须用 hooks、permissions、audit agents 和人工 commit approval 固化为 gate。
这给 Agentic Coding 一个更清晰的双层结构:上层把 agent 当作可组合计算单元,提高吞吐和可复用性;下层用 harness 限制副作用、验证结果和保留交接证据。缺少下层时,loop/scheduler 会放大错误;缺少上层时,agent 仍停留在一次性聊天。
写入记录
- 2026-08-03 09:00 CST:补充 Awesome Agentic DevOps、ultracodex、record-and-replay-skill、Claude Starter Kit 对 operator-safety catalog、agent-as-function、示范到 skill、tool-level gates 的启发。
- 2026-07-21 09:01 CST:补充 Flow-Next、Harness Score、NeMo Relay、FastContext 对 agent workflow、harness scoring、runtime trajectory 或只读上下文探索的启发。
- 2026-07-01 09:00 CST:补充 AgentOps 的完成门禁原则,强调 coding agent 的独立验证。
- 2026-07-05 09:02 CST:补充 Lovable 高吞吐 agentic coding 对风险分层、PR 粒度和人类注意力分配的启发。
- 2026-07-13 09:00 CST:补充 did-it 对完成声明、transcript receipts 和 unsupported claims 的启发。
- 2026-07-14 09:00 CST:补充 SETA、execute_code 工具面实验与 AIGX 对环境生成、工具面、仓库上下文格式的启发。
- 2026-07-15 09:02 CST:补充 ACQUIRE 的先问后修模式,强调 coding agent 应先显式化仓库知识缺口再行动。
- 2026-07-16 09:00 CST:补充 set-shifting 工具路由视角,强调 coding agent 需要根据新证据摆脱旧工具/搜索/验证 routine。
- 2026-07-17 09:00 CST:补充 coding-agent 安全债务与 review-derived 行为规则,强调高吞吐开发需要 security pass 和跨会话错误复发治理。