← 返回藏书阁

coder_eval — evaluate AI coding agents & their skills

wiki/ai/sources/coder-eval-skill-evaluation-ci.md
分类:ai / sources · 更新:2026-07-19 09:05

coder_eval — evaluate AI coding agents & their skills

为什么这对用户重要

coder_eval 把 coding agent 与 agent skills 的质量评估从“感觉好用”推进到可复现实验:用声明式 YAML 任务、沙箱、连续/加权评分、telemetry、A/B agent 配置和 CI gate 来验证 Claude Code、Codex、Gemini/Antigravity 等 agent 或 skill 是否真的在目标任务上生效。对 Hermes 来说,它最直接的价值是:把本地 skill、cron workflow、llm-wiki ingest 流程都看成可回归测试的工程资产,而不是一次写完后长期相信。它与 Agent-BenchmarksHarness-EngineeringExternal-Agent-Skills-Design-Patterns 直接相连。

机制 / 一阶原理

coder_eval 的核心机制是把一次 agent run 拆成四个可审计对象:

  1. 任务合同:YAML 定义任务、依赖、成功标准与评分维度;这避免 benchmark 只停留在自然语言 prompt。
  2. 隔离执行:每个任务在 sandbox 中运行,并记录工具调用、token、成本和产物;这让失败可以复盘,而不是只得到一个 pass/fail。
  3. 连续评分:不是只有 0/1,criterion 可以给 fractional credit、threshold 和 weighted score,适合评估 skill 触发、部分正确、成本与质量权衡。
  4. CI 化回归:官方 CI 教程把步骤固定为 pinned install → secret injection → run task glob → parse task.json verdict → upload artifacts;这正好对应 Harness-Engineering 的 proof-or-stop 思路。

这说明 agent skill 的“完成定义”不应由 agent 自己汇报,而应由任务文件、run artifact 和 verdict 共同决定。

和已有 wiki 概念的关系

  • Agent-Benchmarks:补充了“评测 agent/skills 工具本身”的可操作实现,而不只是论文 benchmark。
  • External-Agent-Skills-Design-Patterns:提供 skill regression 的执行层;高质量 skill 应有 with-skill / baseline / old-skill 对照。
  • Harness-Engineering:把 harness 的质量、成本、工具调用与 skill trigger 变成可测变量。
  • Loop-Engineering:scheduled CI 可以持续发现模型、prompt 或 skill 漂移,避免长期无人自动化静默退化。

对 Hermes / llm-wiki 的可执行启发

  1. 为 llm-wiki radar 建 3–5 个最小 eval task:是否 orient、是否保存 raw+sha、是否更新 _index.md/log.md、是否给未入库原因、是否追加「写入记录」。
  2. 对高风险 Hermes skill 改动,至少保留一个 with-skill vs no-skill 样例;如果 skill 没有可验证产物,就不要晋升为长期自动加载资产。
  3. 在 CI/cron 场景关闭 telemetry,并 pin 版本,避免评测框架升级导致结果不可比较。
  4. task.json / run artifact 当作 claim receipt:日报里“已验证”应能追到真实任务产物。

失败模式 / 边界条件

  • coder_eval 需要 Python 3.13+ 和对应 agent CLI,用户当前 macOS 环境 Python 3.12.13;本机直接运行可能要额外环境,不应默认引入到现有 cron。
  • LLM-graded rubric 仍可能自证循环;关键任务需要 deterministic checks 或人工 verdict。
  • 任务设计会决定评测结论:如果 task 太窄,skill 可能过拟合;如果 task 太泛,分数不可解释。
  • 评测框架自身有 telemetry,CI 中应显式 TELEMETRY_ENABLED=false

深度判断

值得深挖:它满足“可复用 workflow + 改进 Hermes/llm-wiki 实践 + agent skill 评测工具”三项价值触发。今天先晋升为 source note,不直接安装或改造本地 cron,因为运行环境版本和评测任务设计还需要单独决策。

相关页面

写入记录

  • 2026-07-19 09:04 CST:新增 coder_eval source note,提炼其对 agent/skill CI 回归评测、claim receipts 与 llm-wiki radar eval 的启发。