Better Harness — evidence-bounded coding workflow review
Better Harness — evidence-bounded coding workflow review
为什么值得入库
Better Harness 值得深挖,不是因为它又提供一个 coding-agent wrapper,而是因为它把“改进 AI coding workflow”转成了可审计的报告对象:从项目 evidence、session evidence、harness 机制、验证结果和学习闭环中找缺口,并把每个 finding 绑定到可见证据、预期输出、修复动作和 acceptance checks。它直接补强 Harness-Engineering 和 Agent-Benchmarks 里反复出现的 claim receipt / workflow verdict 问题。
对用户的 Hermes / llm-wiki 实践,关键启发是:每日雷达不应只说“入库了 N 个页面”,而应能按固定维度评价本次 workflow 是否完成了 orient、发现、原文读取、raw 留存、深度判断、index/log、向量重建和未入库说明。
机制 / 一阶原理
Better Harness 的基本机制是把 agent work loop 拆成五类可观察维度,而不是直接给单一好坏分:任务理解、上下文准备、受控执行、变更验证、交付/学习。每一维都要求 evidence;缺证据的地方保持显式未知,而不是把主观评分伪装成事实。
这是一种“workflow reviewer as harness”的模式:它不替代 Claude Code / Codex / Cursor 执行任务,而是站在执行层旁边检查任务周围是否存在足够的工程支架。三类独立 evidence agent 先分别收集证据,再由 lead agent 统一分析,能减少单一叙事把缺口抹平的风险。
和既有 wiki 概念的关系
- 对 Harness-Engineering:补充了“harness 本身也要被复盘”的操作形态。不是只检查测试是否通过,也检查上下文、路径、验证和学习机制是否存在。
- 对 Agent-Benchmarks:提供了 workflow-level micro-benchmark 的模板。它不适合当公开 leaderboard,但适合作为个人/团队 AI coding 流程的连续健康报告。
- 对 Context-Engineering:强调 session/project evidence 的边界;没有被读取或引用的上下文不能算真正生效。
对 Hermes / llm-wiki 的可执行启发
- 给 AI radar 增加轻量 “Better Harness checklist”:候选来源是否有原文、是否查重、是否满足深度阈值、是否更新概念页、是否写入记录、是否验证索引/向量。
- 对复杂 coding task,可在完成后生成
.hermes/harness-report.md,按同样五维记录证据和缺口。 - 将“缺证据”作为一等输出:如果无法访问 arXiv 或网页,应明确列为 missing evidence,而不是用训练知识补齐。
失败模式 / 边界
- 它评估的是 workflow 机制和证据,不保证最终业务决策正确。
- 报告质量依赖可访问的 session/project traces;如果宿主不暴露 transcript,结论只能降级。
- 如果团队把报告分数化、KPI 化,可能诱导“为了报告好看而补表面 evidence”。
- 当前入库基于 README,未运行插件;因此 confidence 设为 medium。
写入记录
- 2026-07-30 09:00 CST:基于 GitHub README 新增 Better Harness 作为 evidence-bounded workflow review 样本,提炼对 Hermes radar/checklist 的启发。