← 返回藏书阁

PawBench:Model × Harness 共评测的 Agent Benchmark

wiki/ai/sources/pawbench-model-harness-coevaluation.md
分类:ai / sources · 更新:2026-07-20 09:05

PawBench:Model × Harness 共评测的 Agent Benchmark

一句话结论

PawBench 的核心主张是 Agent Performance = f(Model, Harness):同一个模型放进不同 agent runtime / harness 后,表现可能出现接近模型升级幅度的差异。它用 150 个任务、9 个模型、3 个 harness 和切片诊断来评估模型与 harness 的交互,而不是只给一个模型排行榜。

为什么对用户重要

用户维护 Hermes 与 llm-wiki 时,经常会面对“换模型还是改 harness”的决策。PawBench 的价值在于把这个问题从主观体验变成可测变量:如果同模型在不同 harness 上差 10 分以上,那么盲目升级模型可能不是最高 ROI;改进工具发现、技能加载、workspace awareness、web access、completion check 可能更有效。README 初始结果还显示 skill-heavy tasks 是最难切片之一,这与用户关注 skills 生态、Hermes skill 调用和 wiki-assisted workflows 高度相关。

机制 / 一阶原理

PawBench 保留 model 和 harness 两个维度,并提供任务标签、grader、submission、leaderboard slices 与 diagnostic traces。它强调单一 pass rate 无法解释失败来源:失败可能来自模型推理、工具缺失、skill discovery、workspace awareness、web access 或过松的完成检查。

一阶原理是:agent 是模型与环境接口的组合系统。模型能力必须通过 harness 暴露为行动能力;harness 也会通过上下文选择、工具路由、状态管理和验证门禁限制或放大模型能力。因此评测对象应从“模型”扩展为“模型 × harness × task slice”。

和现有 wiki 的关系

  • Agent-Benchmarks:PawBench 是从 model-only leaderboard 转向 co-evaluation 的具体案例。
  • Harness-Engineering:它把 harness gap 量化为可观察分数差,支持“harness 是工程变量,不是包装层”的观点。
  • Context-Engineering:skill-heavy、multimodal、open-environment 等切片能帮助定位上下文和工具加载问题。
  • Agentic-Coding:coding agent 的成功率、成本和可靠性都应按任务切片看,而不是被总体分数掩盖。

对 Hermes / llm-wiki 的可执行启发

  1. Hermes 自评测不应只记录“任务成功/失败”,还应标注失败切片:工具选择、网页读取、文件编辑、wiki 链接、vector retrieval、最终交付。
  2. 每日 AI radar 可以维护一个小型 task slice 集合:搜索发现、原文读取、raw 保存、source 页深度、index/log 更新、reindex 验证,以衡量 harness 改动是否改善实际流程。
  3. 新增/调整 skill 时,优先在 skill-heavy 切片上验证,因为 PawBench 这类结果显示 skill discovery 与 procedural execution 仍然脆弱。
  4. 对外部 benchmark 报告,要追问是否固定了 harness、是否公开 trace、是否能按任务类别诊断,否则分数可解释性有限。

失败模式 / 边界

  • PawBench 的初始分数来自特定模型、harness 和 judge 配置,不能直接外推到所有 agent 场景。
  • 使用 LLM judge 会引入 judge 偏差;需要结合公开 prompts、graders、trace 和可复现实验看。
  • Benchmark 可能被 harness 过拟合;真正有价值的是切片诊断和失败 trace,而不是只追 leaderboard。
  • 对用户的 llm-wiki 场景,需要自定义任务集,不能直接把 PawBench 分数当 Hermes 质量指标。

深度判断

晋升为正式 source 页的原因:PawBench 直接验证了用户知识库反复强调的 Harness Engineering 观点,并提供“Model × Harness × Slice”的评测框架,可用于改进 Hermes 自身任务评估和新工具筛选。

写入记录

  • 2026-07-20 09:00 CST:新增 PawBench source 页,提炼 model-harness co-evaluation、切片诊断和 Hermes 自评测启发。