Caliper — Reliability testing for agent skills
Caliper — Reliability testing for agent skills
Caliper 是一个面向 agent skill 的可靠性评测工具:把同一个 skill 在 Claude Code、Codex 或 Pi 等 agent 上重复运行 k 次,和无 skill 的 baseline 对比,输出 pass@k、delta 与可追溯结果文件。它关注的不是“这个 skill 看起来写得好不好”,而是“它是否在可重复任务上稳定提高成功率”。
为什么对用户重要
用户的 Hermes / llm-wiki 正在持续吸收外部 skills、维护本地 skill,并把许多工作流自动化。随着 skill 数量增加,真正风险会从“没有流程”转为“流程文档很多但没人知道是否有效”。Caliper 给出一个轻量答案:为每个重要 skill 定义 3 类任务(happy path、edge case、adversarial),重复运行,并与 base agent 做对照。这直接补上 External-Agent-Skills-Design-Patterns 里的“质量评估闭环”。
机制 / 一阶原理
Caliper 的核心机制是把 skill 评测拆成四层:
.eval.yaml规定 skill 路径、agent backend、judge backend、任务 prompt 和断言。- Harness 在隔离临时 home 中多次运行 agent,减少历史会话和本机状态污染。
- Judge 可以是 LLM autorater,也可以是确定性 Python
assert,因此既能评估文本质量,也能验证真实文件/配置/命令产物。 - 结果保存为 JSON,可随时间比较 prompt 修改、模型更新或 skill 重构带来的回归。
它的关键点不是 pass@k 数学本身,而是skill 必须和 baseline 对照。一个任务 100% 通过可能只是 base agent 本来就会;只有 skill 与 baseline 的 delta 才说明 skill 的真实增益。
和已有 wiki 概念的关系
- Agent-Benchmarks:Caliper 把公开 benchmark 的思想下沉到本地 skill 维护,形成 micro-benchmark。
- External-Agent-Skills-Design-Patterns:为 skill 创建、修改、晋升提供可执行门禁。
- Harness-Engineering:它本质上是 skill 级 harness;agent 不只执行任务,还被一个可重复评测框架包裹。
- AI-Code-Review:对 review skill 或代码生成 skill,可以把“证据分层、断言、反例任务”写成 eval specs。
对 Hermes / llm-wiki 的可执行启发
- 为高频 Hermes skills 建立最小 eval:每个 skill 至少 3 个任务,覆盖正常、边界和误触发。
- 修改 skill 后先跑 k=1 smoke test,再跑 k=3 对比 baseline;只有 delta 为正且无严重误触发,才晋升为稳定版本。
- 对 llm-wiki,可设计摄入 eval:给定一个来源,检查是否 orient、是否保存 raw、是否更新 index/log、是否写入记录、是否避免重复页面。
- 对每日雷达,可设计“候选筛选 eval”:输入多条来源,判断是否能拒绝低质量/骗局/薄项目,而不是全部入库。
失败模式与边界
- LLM judge 可能偏好流畅输出而非真实完成;关键任务应尽量加入确定性
assert。 - k 太小只能发现明显不稳定;k 太大成本上升,适合核心 skill 或发布前回归。
- 评测 spec 本身会老化:当 Hermes 规则、目录结构或工具变化后,旧断言可能测试的是过时行为。
- skill 通过 eval 不代表真实场景无风险;它只覆盖 spec 写出的行为边界。
写入记录
- 2026-07-03 09:00 CST:新增 Caliper source 页,分析 skill 可靠性评测、baseline 对照和对 Hermes skill 维护的启发。