AgentOps coding-agent verification membrane
AgentOps coding-agent verification membrane
boshu2/agentops 是一个面向 coding agents 的 repo-native 验证层。它的核心主张很窄但很重要:coding agent 宣称“完成”不应算完成,必须由没有写这次修改的东西来检查——另一个模型、真实测试、或显式 gate;No verdict = not done。
为什么对用户重要
这直接击中 Hermes / llm-wiki / agentic coding 的高频失败模式:agent 很容易把“我已经改了文件”误当成“任务已被证据验证”。用户的工作流已经强调“Finishing the job”和真实工具输出,AgentOps 把这个习惯产品化为可复用 membrane:每次变更必须留下 verdict、evidence 和可检索记录。
对知识库维护尤其重要:wiki 页面更新、向量重建、lint 修复、发布到 CVM 等任务都可能出现“写了但没验”“验了但没记录”“记录不可复核”。AgentOps 的启发是:把验证作为完成定义的一部分,而不是事后补一句 summary。
机制 / 一阶原理
AgentOps 不是新的 coding agent,而是覆盖在 Claude Code、Codex、Cursor、OpenCode 等 agent 之上的验证与记账层。README 描述的关键部件包括:
- validation membrane:
/validate、/pre-mortem、/council等技能把变更交给独立 judge 或真实测试,产生 PASS / REFUTE / HOLD verdict。 - repo-native ledger:运行、决策和 verdict 写入 repo 内
.agents/,形成 grep-able、diff-able、portable 的证据轨迹。 - hash-chained provenance:README 声称 verdict 会绑定到 tamper-evident ledger;重点不是“绝对防篡改”,而是让审查者能追踪一次变更到底被谁/什么检查过。
- skills + CLI 双层接口:agent 侧用
/research、/rpi、/council等技能;人类或 automation 侧可用ao search、ao context assemble、ao gate check、ao metrics health。
一阶原理是把“完成”从生成动作改写为证据状态:代码 diff 只是候选产物;只有经过独立检查并记录 verdict 的候选产物,才进入可信任状态。
与已有 wiki 概念的关系
- 相比 aharness 更强调流程状态机和 typed exits,AgentOps 更强调独立验证、长期 ledger 和跨 agent 可移植证据;二者都属于 Harness-Engineering,但切入点不同。
- 它补强 Agentic-Coding 的第 4/5 步:验证循环与风险控制。尤其适合防止 agent 在复杂仓库中把“看起来合理”包装成“已经通过”。
- 它也让 Agent-Benchmarks 的思想下沉到日常工程:不是只在 benchmark 上测 agent,而是在每个真实任务上生成局部 verdict。
- 对 Agentic-Engineering 而言,它是 command center / multi-agent workflow 中的“完成门禁”:多个 agent 并行越多,越需要一个统一的 evidence ledger。
可执行启发
- Hermes 在执行代码/发布/wiki 更新任务时,可以借鉴 “No verdict = not done”:最终回复应区分“已写入”“已运行”“已验证”“验证失败”。
- llm-wiki 的 ingestion pipeline 可以增加轻量 evidence log:新页面对应 raw 文件、索引更新、lint/链接检查、vector reindex 结果都写进 log,而不只写“创建了页面”。
- 对高风险自动任务,使用“writer agent + verifier pass”模式:写入者负责生成内容,验证者只读文件、检查链接/frontmatter/来源一致性。
- 对 coding agents,优先把
/pre-mortem、/validate、/council这种 checkpoint 设计成可调用 workflow,而不是散落在 prompt 里的建议。
失败模式 / 边界
- 验证成本:独立模型 judge 和真实测试都会消耗 token/时间;低风险小改不应过度流程化。
- judge 也会错:独立模型不是形式化证明,仍需要真实测试、静态检查和人类审查组合。
- ledger 噪音:如果每个微动作都写入
.agents/,长期检索可能变差;需要摘要、压缩和质量门槛。 - 自证循环:如果同一模型既写又验,只是换一个 prompt,独立性有限;最好混合不同模型、真实测试和固定 rubric。
写入记录
- 2026-07-01 09:00 CST:新增 AgentOps source 页面,归纳 coding-agent verification membrane、repo-native ledger 与对 Hermes/llm-wiki 完成定义的启发。