← 返回藏书阁

UniClawBench:真实环境主动式 Agent 基准

wiki/ai/sources/uniclawbench-proactive-agent-benchmark.md
分类:ai / sources · 更新:2026-07-12 09:04

UniClawBench:真实环境主动式 Agent 基准

一句话结论

UniClawBench 是一个面向 proactive agents 的能力驱动 benchmark:它不按“办公/购物/研究”这类场景粗分任务,而按 Skill Usage、Exploration、Long-Context Reasoning、Multimodal Understanding、Cross-Platform Coordination 五种底层能力组织 400 个中英双语真实任务,并用 Docker 运行环境、轨迹/产物、隐藏 supervisor 和 user simulator 做闭环评估。

为什么对用户重要

这篇工作值得深挖,因为它把 Agent-Benchmarks 的焦点从“单轮静态答案”推进到“真实环境里的持续人机闭环”。用户当前维护 Hermes / llm-wiki 雷达时,最容易出现的质量幻觉是:看起来完成了搜索、写页和汇报,但无法诊断失败源到底是工具选择、探索不足、长上下文丢失、视觉/网页理解不足,还是跨应用状态协调失败。UniClawBench 的能力 taxonomy 可以直接转化为 Hermes 任务复盘维度。

机制 / 一阶原理

它的核心机制有三层:

  1. 能力驱动任务分类:每个任务归到主要瓶颈能力,而不是归到应用场景。这让失败分析能落到可改进的 harness 能力上,例如“不会发现文件/网页路径”与“不会使用给定 skill/API”应被分开。
  2. 真实环境 + 产物评估:任务在 live Docker containers 中执行,agent 会产生 trajectories、artifacts、screenshots、logs、hashes、JSON notes 等可审计证据,而不是只提交一个最终字符串。
  3. 三角色闭环:executor agent 执行任务;隐藏 supervisor 基于私有 rubrics 和 references 评估轨迹/产物并给 coarse progress signal;user simulator 用自然反馈继续多轮交互,同时避免把评分标准泄漏给 executor。

这种设计的第一性原理是:真实 agent 能力不是静态问答能力,而是“在有状态环境中,用工具持续降低不确定性并产出可验证 artifact”的能力;因此 benchmark 也必须观察过程、状态和反馈循环。

和现有 wiki 的关系

  • Agent-Benchmarks:补充了 proactive / desktop-like / multi-platform agent 的 capability-level benchmark,不只是 coding benchmark 或 safety benchmark。
  • Harness-Engineering:它的 executor-supervisor-user 三角色结构,本质上是一个评测 harness;隐藏 supervisor 对应 verification membrane,user simulator 对应闭环反馈层。
  • Context-Engineering:Long-Context Reasoning 任务强调跨网页、PDF、视频、邮件、日志等异构证据的一致性维护,与 llm-wiki 的 raw/source/concept/index/log 分层高度相关。

对 Hermes / llm-wiki 的可执行启发

  1. 每次复杂任务报告应增加“失败/风险归因维度”:skill/tool usage、exploration、long-context consistency、multimodal evidence、cross-platform coordination。
  2. 雷达 cron 的验证不应只看是否创建文件;还应看是否留下 raw、读过相关旧页、更新 _index/log、重建向量索引、以及输出是否引用证据。
  3. 对无人 cron,user simulator 不存在,因此应把“可恢复继续”的状态写入 log 或优化文章:哪些候选未入库、缺少什么证据、下一次可以从哪里继续。

失败模式 / 边界

  • 真实环境 benchmark 更接近部署,但也更难复现:网页、服务、模型、框架版本变化会影响分数。
  • Hidden supervisor 能减少 rubric leakage,但 supervisor 本身也可能引入 judge bias 或覆盖不全。
  • 400 个任务覆盖广,但是否代表用户个人工作流仍要校准;llm-wiki 更关心知识发现、来源治理和长期记忆,不一定需要完整桌面任务集。

深度判断

晋升为正式 source 页的原因:它提供了可复用评测方法论,并能直接改进 Hermes/llm-wiki 的任务复盘和 radar harness;不是只给一个新排行榜分数。

写入记录

  • 2026-07-12 09:00 CST:新增 UniClawBench source 页,提炼能力驱动 benchmark、三角色闭环评估和对 Hermes/llm-wiki 的评测启发。