agent-session-io — harness-neutral session substrate
agent-session-io — harness-neutral session substrate
核心判断
agent-session-io 值得进入 wiki,因为它处理了 coding-agent 生态的一个底层但长期重要的问题:不同 harness 的本地 session 轨迹如何被发现、读取、导出和复盘。它不是新的 coding agent,也不是新的 UI,而是一个 Go library + sessionio CLI,面向 Codex 和 Claude Code 等本地会话,提供 harness-neutral 的 session reader。
这对用户重要:Hermes / llm-wiki 的许多改进都依赖“可验证的执行轨迹”。如果 claim、测试、文件修改、工具输出只存在于某个 agent host 的私有日志中,就很难做跨工具评估、失败复盘、知识沉淀和 self-improvement。sessionio 这类 substrate 让“agent 说它做了什么”转向“外部 reader 能导出它实际做了什么”。
机制:最小 reader,而不是新平台
README 强调几个设计点:
- Harness-neutral:以统一接口读取不同 coding-agent harness 的 session,而不是把用户锁进一个新运行时。
- Local-first / no service:核心 reader 不依赖 SQLite、embedding、model provider 或后台服务;这降低了把 session 轨迹纳入脚本和 CI 的门槛。
- Lossless export:
sessionio export SESSION_ID默认流式 NDJSON,适合脚本/agent 消费;show支持 normalized/native/provenance 等 detail。 - Current session discovery:
list --current能发现与 live Codex/Claude 进程关联的会话,便于实时监控或收尾复盘。 - Supply-chain discipline:安装器下载 release archive、校验 SHA-256,并支持 GitHub build provenance attestation。
本质上,它把 session transcript 从“某个产品的 UI 记录”提升为可编程 artifact。
与现有 wiki 概念的关系
- 对 Harness-Engineering:session reader 是 verification membrane 的证据来源之一。没有轨迹,harness 很难证明 agent 是否真的遵守 gate、是否越权、是否运行过命令。
- 对 Loop-Engineering:无人 loop 需要跨轮状态和失败恢复;session export 可作为 loop 的 replay / diagnose 输入。
- 对 Agent-Benchmarks:benchmark 不应只看最终 patch,还应看工具调用、成本、时间、失败重试和证据链;session substrate 是 harness-level eval 的基础设施。
- 对 Agentic-Coding:它补充了“可观察性”维度——编码 agent 的生产力不只由模型和 prompt 决定,也由 session 是否能被审计和复用决定。
对 Hermes / llm-wiki 的可执行启发
- 报告 claim-level receipts:未来 Hermes 如果能导出自身或相邻 coding agent 的 session,就可以把“已运行测试/已重建索引/已写文件”绑定到具体工具输出,而不是只靠自然语言总结。
- 构建失败案例库:把失败 session 的 NDJSON 摘要入库到 raw/notes 或 dedicated eval folder,可用于改进 skills、cron prompt 和 verification gates。
- 跨 host skill 评估:同一 skill 在 Claude Code、Codex、Hermes 下的 session 可被规范化比较,帮助判断差异来自模型、harness 还是上下文。
- 谨慎纳入生产:当前 README 明确 machine output/API 仍是 draft,正式依赖前应冻结契约或加适配层,避免格式变化破坏自动化。
失败模式与边界
- 隐私风险:session transcript 可能包含代码、密钥、用户输入和内部上下文;自动归档前必须做脱敏和范围控制。
- 格式未冻结:README 提到 machine output / Go reader API 在 contract-freeze 前会原地更新;不宜马上做强耦合生产流程。
- 覆盖有限:当前完整支持目标是 Codex 和 Claude Code;其他 harness 需要后续适配。
- 证据不是判决:导出 session 只能说明发生过什么,仍需要 verifier 判断是否正确、安全、越界。
深度判断
晋升理由:它虽然不是高 star 项目,但切中 agent workflow 的持久问题:session 轨迹标准化。对 llm-wiki 的 self-improvement、benchmark、claim verification 都有直接耐久价值。因目前证据主要来自 README 且 API 未冻结,置信度保持 medium。
写入记录
- 2026-07-26 09:00 CST:新增 source 页面,沉淀 agent-session-io 作为跨 harness session reader / evidence substrate 的价值、机制和 Hermes 风险边界。