Greplica:持久仓库记忆的 coding-agent 规划评测
Greplica:持久仓库记忆的 coding-agent 规划评测
核心结论
Greplica 的 benchmark 把“持久仓库记忆是否有用”变成了可测问题:用 SWE-chat 的时间序列会话先构建 memory,再在未来 held-out session 的规划任务上比较 baseline 与 memory arm。报告结果显示,带 Greplica memory 的 agent 在选定 10 个高上下文任务上减少 43% 成本、49% token、36% tool calls、26% 规划时间。
对 Context-Engineering 来说,这比“多放上下文”更具体:真正有价值的是可查询、时间有效、任务相关、可评测的工程记忆。
为什么对用户重要
用户的 llm-wiki 本质上也在做 persistent memory:把 raw/source/concept/entity、log、_index、vector index 变成 agent 下次可复用的上下文。如果没有评测,这套记忆系统可能只是“资料很多”,但不知道是否真的减少重复搜索、提升计划质量、降低 token/工具调用成本。Greplica 提供了一个很适合迁移到 Hermes 的评测框架:比较“从零探索”与“先查 wiki/ConversationSpec/历史决策”的差异。
机制 / 一阶原理
Greplica 的关键不是把所有历史塞进上下文,而是:
- 从 prior coding sessions 的 transcript 和 code changes 中抽取 architectural decisions、failed attempts、gotchas、edge cases;
- 存进 SQLite-backed graph;
- 在新任务开始时先检索相关历史,再让 agent 规划;
- 用未来 held-out session 测试,避免信息泄漏;
- 评估 plan quality、tokens、tool calls、elapsed time。
它测的是 planning phase,因为 coding-agent 很多成本花在定位子系统、理解历史约束和形成初始计划上。错误计划会把后续实现错误放大。
与现有 wiki 概念的关系
| - 对 Context-Engineering:补充“persistent queryable memory”的评测方法,延续 [[agent-context-workshop | Agent Context Workshop]] 对 adoption、determinism、token efficiency 的关注。 |
- 对 Repository-Exploration:减少从 grep/glob/read 开始的重复探索,把历史决策直接作为候选路线。
- 对 Agent-Benchmarks:代表一种 context-provider benchmark,不只测模型,也测上下文系统是否 load-bearing。
- 对 AGENTS.md-Context-Files:说明 AGENTS.md 是有用入口,但不足以承载任务特异、持续更新、历史决策密集的记忆层。
对 Hermes / llm-wiki 的可执行启发
- 把 wiki-vquery 当成 context provider 评测:同一类问题比较 keyword-only、semantic query、人工 index 查找的耗时和答案质量。
- 为 ingest 记录“减少未来 rediscovery 的事实”:source page 不只写摘要,还要写 gotchas、边界、失败模式和可迁移 workflow。
- ConversationSpec 与 llm-wiki 分层:会话内任务状态留在 spec;长期可复用方法论晋升 wiki;两者都要能被新 session 查询。
- 雷达应关注 context-memory tools:Greplica、ContextEcho、Token Warden、Dao Code 这类项目都在尝试把 agent 成本/记忆/缓存工程化,应加入后续关注名单。
失败模式 / 边界条件
- 样本小与 selection bias:当前公开结果是 10 个选定高上下文任务,且多为单次运行;需要更多任务、多次重复和中位数。
- judge 可靠性:plan quality 依赖 LLM judge 与 hidden guidance,仍需人工 audit 或 outcome-level implementation test。
- 记忆污染:历史 session 可能包含错误假设;memory 必须有 provenance、时间、置信度和可删除机制。
- 隐私/安全:transcript memory 会收集大量工程上下文,必须处理 secret、权限和跨项目隔离。
深度判断
值得晋升,因为它直接回答 llm-wiki 的核心问题:长期知识库/记忆层如何证明自己真的减少重复探索并改善 agent 工作流。它不是短期工具新闻,而是可迁移的评测方法。
写入记录
- 2026-07-07 09:00 CST:基于 Greplica benchmark 文章创建 source page,提炼 persistent repository memory、held-out temporal evaluation 与 llm-wiki 自评测启发。