coder_eval — evaluate AI coding agents & their skills
coder_eval — evaluate AI coding agents & their skills
为什么这对用户重要
coder_eval 把 coding agent 与 agent skills 的质量评估从“感觉好用”推进到可复现实验:用声明式 YAML 任务、沙箱、连续/加权评分、telemetry、A/B agent 配置和 CI gate 来验证 Claude Code、Codex、Gemini/Antigravity 等 agent 或 skill 是否真的在目标任务上生效。对 Hermes 来说,它最直接的价值是:把本地 skill、cron workflow、llm-wiki ingest 流程都看成可回归测试的工程资产,而不是一次写完后长期相信。它与 Agent-Benchmarks、Harness-Engineering 和 External-Agent-Skills-Design-Patterns 直接相连。
机制 / 一阶原理
coder_eval 的核心机制是把一次 agent run 拆成四个可审计对象:
- 任务合同:YAML 定义任务、依赖、成功标准与评分维度;这避免 benchmark 只停留在自然语言 prompt。
- 隔离执行:每个任务在 sandbox 中运行,并记录工具调用、token、成本和产物;这让失败可以复盘,而不是只得到一个 pass/fail。
- 连续评分:不是只有 0/1,criterion 可以给 fractional credit、threshold 和 weighted score,适合评估 skill 触发、部分正确、成本与质量权衡。
- CI 化回归:官方 CI 教程把步骤固定为 pinned install → secret injection → run task glob → parse
task.jsonverdict → upload artifacts;这正好对应 Harness-Engineering 的 proof-or-stop 思路。
这说明 agent skill 的“完成定义”不应由 agent 自己汇报,而应由任务文件、run artifact 和 verdict 共同决定。
和已有 wiki 概念的关系
- 对 Agent-Benchmarks:补充了“评测 agent/skills 工具本身”的可操作实现,而不只是论文 benchmark。
- 对 External-Agent-Skills-Design-Patterns:提供 skill regression 的执行层;高质量 skill 应有 with-skill / baseline / old-skill 对照。
- 对 Harness-Engineering:把 harness 的质量、成本、工具调用与 skill trigger 变成可测变量。
- 对 Loop-Engineering:scheduled CI 可以持续发现模型、prompt 或 skill 漂移,避免长期无人自动化静默退化。
对 Hermes / llm-wiki 的可执行启发
- 为 llm-wiki radar 建 3–5 个最小 eval task:是否 orient、是否保存 raw+sha、是否更新
_index.md/log.md、是否给未入库原因、是否追加「写入记录」。 - 对高风险 Hermes skill 改动,至少保留一个 with-skill vs no-skill 样例;如果 skill 没有可验证产物,就不要晋升为长期自动加载资产。
- 在 CI/cron 场景关闭 telemetry,并 pin 版本,避免评测框架升级导致结果不可比较。
- 把
task.json/ run artifact 当作 claim receipt:日报里“已验证”应能追到真实任务产物。
失败模式 / 边界条件
coder_eval需要 Python 3.13+ 和对应 agent CLI,用户当前 macOS 环境 Python 3.12.13;本机直接运行可能要额外环境,不应默认引入到现有 cron。- LLM-graded rubric 仍可能自证循环;关键任务需要 deterministic checks 或人工 verdict。
- 任务设计会决定评测结论:如果 task 太窄,skill 可能过拟合;如果 task 太泛,分数不可解释。
- 评测框架自身有 telemetry,CI 中应显式
TELEMETRY_ENABLED=false。
深度判断
值得深挖:它满足“可复用 workflow + 改进 Hermes/llm-wiki 实践 + agent skill 评测工具”三项价值触发。今天先晋升为 source note,不直接安装或改造本地 cron,因为运行环境版本和评测任务设计还需要单独决策。
相关页面
写入记录
- 2026-07-19 09:04 CST:新增 coder_eval source note,提炼其对 agent/skill CI 回归评测、claim receipts 与 llm-wiki radar eval 的启发。