record-and-replay-skill
record-and-replay-skill
为什么值得深挖
record-and-replay-skill 解决的是 agent skill 生态里一个很关键但常被低估的问题:很多 workflow 用户说不清,但能演示。该项目让用户在浏览器或桌面上操作一次,记录事件、DOM/screenshot/selector 候选和上下文,再由 coding agent 把证据转成可复用 SKILL.md 风格 skill。对用户的 Hermes 实践,这提供了“从人类示范到 skill”的低摩擦采集路径。
机制 / 一阶原理
它不是录视频后让模型猜,而是记录结构化 evidence stream:浏览器模式用 Playwright 获取 action、selector candidates、trace chunks、DOM snapshot 和 screenshot;桌面模式记录鼠标/键盘、active window 和点击截图。Agent 读取 compact summary 后,应把这些证据理解为“用户意图”和“稳定定位线索”,再生成带语义 locator、验证步骤和 fallback 的 skill。
这和 External-Agent-Skills-Design-Patterns 的“经验采集与晋升门槛”一致:skill 不应只从空想 prompt 中写出,而应来自真实演示、可回放证据和验证步骤。它也连接 Context-Engineering:示范轨迹是一种高信号上下文,比用户口述更能暴露隐性顺序、界面状态和边界条件。
对 Hermes / llm-wiki 的启发
- 对用户重复执行的网页/桌面 workflow,可以先做 record-only raw capture,再由 Hermes 生成候选 skill;未经验证前只入 wiki/source,不自动安装。
- skill 晋升条件应包含:真实演示证据、生成的 workflow、至少一次 replay/self-test、失败 fallback 和安全边界。
- llm-wiki 可增加“workflow demonstration → raw trace → source note → skill candidate → verified skill”的生命周期视角,避免把未验证自动化直接变成常驻能力。
失败模式与边界
- 录制轨迹可能包含敏感信息、账号状态或私有页面内容;默认应视为高敏 raw,不宜外传。
- UI 自动化容易受 selector drift、A/B 实验、多语言和登录状态影响;必须有语义 locator 和 verification step。
- “能演示一次”不等于“可安全自动化”;涉及购买、发布、删除、发消息等副作用时,应默认要求人工 approval。
相关页面
- External-Agent-Skills-Design-Patterns
- Context-Engineering
- Agent-Skill-Discovery
- browser-act-skill-forge
写入记录
- 2026-08-03 09:00 CST:新增 record-and-replay-skill 来源页,沉淀从用户演示采集 workflow 并晋升为可验证 skill 的模式。