← 返回藏书阁

Caliper — Reliability testing for agent skills

wiki/ai/sources/caliper-skill-reliability-testing.md
分类:ai / sources · 更新:2026-07-03 09:07

Caliper — Reliability testing for agent skills

Caliper 是一个面向 agent skill 的可靠性评测工具:把同一个 skill 在 Claude Code、Codex 或 Pi 等 agent 上重复运行 k 次,和无 skill 的 baseline 对比,输出 pass@k、delta 与可追溯结果文件。它关注的不是“这个 skill 看起来写得好不好”,而是“它是否在可重复任务上稳定提高成功率”。

为什么对用户重要

用户的 Hermes / llm-wiki 正在持续吸收外部 skills、维护本地 skill,并把许多工作流自动化。随着 skill 数量增加,真正风险会从“没有流程”转为“流程文档很多但没人知道是否有效”。Caliper 给出一个轻量答案:为每个重要 skill 定义 3 类任务(happy path、edge case、adversarial),重复运行,并与 base agent 做对照。这直接补上 External-Agent-Skills-Design-Patterns 里的“质量评估闭环”。

机制 / 一阶原理

Caliper 的核心机制是把 skill 评测拆成四层:

  1. .eval.yaml 规定 skill 路径、agent backend、judge backend、任务 prompt 和断言。
  2. Harness 在隔离临时 home 中多次运行 agent,减少历史会话和本机状态污染。
  3. Judge 可以是 LLM autorater,也可以是确定性 Python assert,因此既能评估文本质量,也能验证真实文件/配置/命令产物。
  4. 结果保存为 JSON,可随时间比较 prompt 修改、模型更新或 skill 重构带来的回归。

它的关键点不是 pass@k 数学本身,而是skill 必须和 baseline 对照。一个任务 100% 通过可能只是 base agent 本来就会;只有 skill 与 baseline 的 delta 才说明 skill 的真实增益。

和已有 wiki 概念的关系

  • Agent-Benchmarks:Caliper 把公开 benchmark 的思想下沉到本地 skill 维护,形成 micro-benchmark。
  • External-Agent-Skills-Design-Patterns:为 skill 创建、修改、晋升提供可执行门禁。
  • Harness-Engineering:它本质上是 skill 级 harness;agent 不只执行任务,还被一个可重复评测框架包裹。
  • AI-Code-Review:对 review skill 或代码生成 skill,可以把“证据分层、断言、反例任务”写成 eval specs。

对 Hermes / llm-wiki 的可执行启发

  1. 为高频 Hermes skills 建立最小 eval:每个 skill 至少 3 个任务,覆盖正常、边界和误触发。
  2. 修改 skill 后先跑 k=1 smoke test,再跑 k=3 对比 baseline;只有 delta 为正且无严重误触发,才晋升为稳定版本。
  3. 对 llm-wiki,可设计摄入 eval:给定一个来源,检查是否 orient、是否保存 raw、是否更新 index/log、是否写入记录、是否避免重复页面。
  4. 对每日雷达,可设计“候选筛选 eval”:输入多条来源,判断是否能拒绝低质量/骗局/薄项目,而不是全部入库。

失败模式与边界

  • LLM judge 可能偏好流畅输出而非真实完成;关键任务应尽量加入确定性 assert
  • k 太小只能发现明显不稳定;k 太大成本上升,适合核心 skill 或发布前回归。
  • 评测 spec 本身会老化:当 Hermes 规则、目录结构或工具变化后,旧断言可能测试的是过时行为。
  • skill 通过 eval 不代表真实场景无风险;它只覆盖 spec 写出的行为边界。

写入记录

  • 2026-07-03 09:00 CST:新增 Caliper source 页,分析 skill 可靠性评测、baseline 对照和对 Hermes skill 维护的启发。