AxisAgentic — runtime and trajectory collection framework for long-horizon agents
AxisAgentic — runtime and trajectory collection framework for long-horizon agents
核心判断
AxisAgentic 值得入库,因为它把长程 agent runtime、trajectory collection、recovery/replay、benchmark evaluation 与 SFT export 放在同一条轨迹合同里;这直接连接了 harness 执行、评测和后训练数据生产。
机制 / 一阶原理
AxisAgentic 的机制是 append-only runtime trace:每个任务记录模型可见状态、工具事件、token/timing/provenance、evaluation artifacts,并支持在任意阶段重建上下文、恢复、回放或筛选为 SFT 数据。模型、工具、orchestrator、dataset、evaluator、reward function 和 policy 都可替换,因此 runtime trace 成为跨实验的公共事实层。
与现有 wiki 的关系
这篇来源主要连接 Harness-Engineering、Agent-Benchmarks、Context-Engineering。它不是孤立工具记录,而是补充了 AI/工程知识库里“可复用 workflow、上下文治理、运行轨迹和评测证据”这条主线。
对 Hermes / llm-wiki 的启发
- Hermes/llm-wiki 的每日 radar 也应把“发现候选→读取原文→晋升/拒绝→写入→验证”的轨迹看成可评测数据,而不只是最终报告。
- coding-agent workflow 如果能保存模型可见上下文和工具事件,就能支持 claim receipts、失败 replay 和后续 skill/SOP 学习。
- 后训练数据不应只抓最终成功答案;应筛选具备可恢复上下文、验证 artifacts 和 provenance 的轨迹。
失败模式 / 边界条件 / 未解问题
- README 强调框架能力,但真实稳定性仍需通过样例运行、长任务失败恢复和 evaluator 复现验证。
- 轨迹越完整,隐私、凭证、敏感上下文过滤越重要。
- 如果 reward/export 只偏向“完成”,可能把越界工具使用或不诚实报告固化进训练数据。
深度判断
本来源被晋升为正式 source page,是因为它至少满足一个耐久价值标准:提供可迁移 workflow 或机制、能改进 Hermes / llm-wiki / agentic coding 实践,且能与已有概念页发生实质连接。当前置信度标为 medium:已读取 GitHub README,但尚未通过本地安装、完整文档审查或独立 benchmark 复核。
写入记录
- 2026-08-02 09:01 CST:从 GitHub README 深度入库,保存 raw,并提炼机制、wiki 关系、实践启发与失败模式。