← 返回藏书阁

Better Harness — evidence-bounded coding workflow review

wiki/ai/sources/better-harness-evidence-bounded-workflow-review.md
分类:ai / sources · 更新:2026-07-30 09:12

Better Harness — evidence-bounded coding workflow review

为什么值得入库

Better Harness 值得深挖,不是因为它又提供一个 coding-agent wrapper,而是因为它把“改进 AI coding workflow”转成了可审计的报告对象:从项目 evidence、session evidence、harness 机制、验证结果和学习闭环中找缺口,并把每个 finding 绑定到可见证据、预期输出、修复动作和 acceptance checks。它直接补强 Harness-EngineeringAgent-Benchmarks 里反复出现的 claim receipt / workflow verdict 问题。

对用户的 Hermes / llm-wiki 实践,关键启发是:每日雷达不应只说“入库了 N 个页面”,而应能按固定维度评价本次 workflow 是否完成了 orient、发现、原文读取、raw 留存、深度判断、index/log、向量重建和未入库说明。

机制 / 一阶原理

Better Harness 的基本机制是把 agent work loop 拆成五类可观察维度,而不是直接给单一好坏分:任务理解、上下文准备、受控执行、变更验证、交付/学习。每一维都要求 evidence;缺证据的地方保持显式未知,而不是把主观评分伪装成事实。

这是一种“workflow reviewer as harness”的模式:它不替代 Claude Code / Codex / Cursor 执行任务,而是站在执行层旁边检查任务周围是否存在足够的工程支架。三类独立 evidence agent 先分别收集证据,再由 lead agent 统一分析,能减少单一叙事把缺口抹平的风险。

和既有 wiki 概念的关系

  • Harness-Engineering:补充了“harness 本身也要被复盘”的操作形态。不是只检查测试是否通过,也检查上下文、路径、验证和学习机制是否存在。
  • Agent-Benchmarks:提供了 workflow-level micro-benchmark 的模板。它不适合当公开 leaderboard,但适合作为个人/团队 AI coding 流程的连续健康报告。
  • Context-Engineering:强调 session/project evidence 的边界;没有被读取或引用的上下文不能算真正生效。

对 Hermes / llm-wiki 的可执行启发

  1. 给 AI radar 增加轻量 “Better Harness checklist”:候选来源是否有原文、是否查重、是否满足深度阈值、是否更新概念页、是否写入记录、是否验证索引/向量。
  2. 对复杂 coding task,可在完成后生成 .hermes/harness-report.md,按同样五维记录证据和缺口。
  3. 将“缺证据”作为一等输出:如果无法访问 arXiv 或网页,应明确列为 missing evidence,而不是用训练知识补齐。

失败模式 / 边界

  • 它评估的是 workflow 机制和证据,不保证最终业务决策正确。
  • 报告质量依赖可访问的 session/project traces;如果宿主不暴露 transcript,结论只能降级。
  • 如果团队把报告分数化、KPI 化,可能诱导“为了报告好看而补表面 evidence”。
  • 当前入库基于 README,未运行插件;因此 confidence 设为 medium。

写入记录

  • 2026-07-30 09:00 CST:基于 GitHub README 新增 Better Harness 作为 evidence-bounded workflow review 样本,提炼对 Hermes radar/checklist 的启发。