← 返回藏书阁

PinchBench

wiki/ai/sources/pinchbench.md
分类:ai / sources · 更新:2026-07-04 09:08

PinchBench

PinchBench 是 OpenClaw 生态中的 agent benchmark skill,用真实任务评估 LLM 作为 agent brain 时的工具调用、多步推理、文件/邮件/日历/研究/代码/记忆等能力。它值得入库的原因不是“又一个排行榜”,而是它把 benchmark 包装成可运行 skill,并覆盖接近个人桌面 agent 的混合任务,这和 Hermes 未来评估 cron、wiki-ingest、agentic coding workflow 的方式高度相关。

为什么对用户重要

用户关心的不是模型在孤立题目上得分,而是 Hermes 能否完成真实工作:找资料、保存 raw、更新 wiki、运行验证、给出可追踪报告。PinchBench 的价值在于把这些真实工作拆成可执行任务,并允许本地或官方 leaderboard 运行。对 llm-wiki 来说,它提示我们应从“今天有没有发现内容”升级到“雷达 workflow 是否稳定完成了发现 → 阅读 → 入库 → reindex → 汇报”。

机制:benchmark as skill

PinchBench README 描述了 53 个任务,覆盖 productivity、research、writing、coding、analysis、email、memory、skills 等类别。每个任务由自动评分、LLM judge 或两者结合评分;运行时需要 OpenClaw 实例和 provider/model 配置,结果可上传 leaderboard,也可本地运行。

这类设计有三个机制特点:

  1. 任务接近真实桌面工作:不是只测代码补全,而是测日历、邮件、文件、网页研究、记忆召回等跨工具任务。
  2. 模型与 agent runtime 分离:benchmark 关心模型作为 brain 放进 OpenClaw 后的表现,因此分数受模型、工具协议、runtime、skill 描述共同影响。
  3. skill 化分发:benchmark 本身作为 repo/skill 存在,降低复现门槛,也让 agent 生态可以像测试套件一样共享任务。

与既有 wiki 概念的关系

- 对 Agent-Benchmarks:PinchBench 补上了桌面/个人生产力 agent 的真实任务维度,和 Agents-Last-Exam 的经济任务、SWE-Explore 的仓库探索、[[coda-benchCODA-BENCH]] 的数据密集任务互补。
  • Harness-Engineering:benchmark 需要一个可控 runtime 和评分边界;否则任务结果会受权限、外部状态和 judge 噪音污染。
- 对 [[agent-skill-ecosystem-2026-06-30Agent Skill Ecosystem]] 与 External-Agent-Skills-To-Adapt:它说明 skill 不只是“让 agent 做事”的包,也可以是“测 agent 是否会做事”的包。
  • Context-Engineering:memory/context retrieval 被列为任务类别,说明上下文系统应该作为一等能力被测,而不是仅凭感觉维护。

对 Hermes / llm-wiki 的启发

  1. 建立 wiki-radar benchmark set:抽取 5-10 个固定任务,例如“发现一个新 benchmark 并正确判断是否入库”“更新已有概念页并追加写入记录”“不重复创建已有实体”。
  2. 评分不要只靠最终文字:应检查文件是否存在、raw frontmatter 是否有 sha256、_index/log 是否更新、wikilinks 是否可解析、vector index 是否重建。
  3. 把 cron 当作 agent workflow 测试对象:每日雷达可以有 pass/fail verdict,例如:发现阶段完成、至少阅读 N 个原文、深度判断写明、无高价值内容时可 silent。
  4. 注意 runtime 依赖:PinchBench 需要 OpenClaw;Hermes 若借鉴其任务集,应先做最小可本地运行的 markdown/file/tool benchmark,而不是立即引入重 runtime。

失败模式与边界

  • Leaderboard 分数可能混合了模型能力、agent runtime、工具权限和 judge 偏差,不应简单解释为模型本身能力。
  • 真实任务依赖外部服务状态,复现性比静态 benchmark 更难。
  • LLM judge 适合开放任务,但关键工程任务仍需要确定性检查。
  • 若 benchmark skill 本身过度适配某个 runtime,迁移到 Hermes 前需要重写工具接口和评分器。

写入记录

  • 2026-07-04 09:00 CST:新增 PinchBench 深度入库,提炼 benchmark-as-skill、真实桌面任务和 wiki-radar 评测启发。