What to Keep, What to Forget — A Rate-Distortion View of Memory Compaction in LLMs and Agents
What to Keep, What to Forget — Agent Memory Compaction 的率失真视角
一句话结论
这篇论文把 KV cache、prompt pruning、architectural state 和 agent 长期记忆统一成一个 rate-distortion 问题:在 token、compute、latency、storage 等预算约束下,决定哪些上下文衍生信息值得保留、以什么保真度保留,以及丢弃会对未来任务造成多大效用损失。
为什么对用户重要
这篇值得深挖,因为它直接击中 Context-Engineering、LLM-Wiki 和 Hermes 长期运行的核心矛盾:知识越积越多,但每次任务可消费的上下文、检索结果、记忆槽和 attention 预算有限。真正的问题不是“要不要记忆”,而是“以什么预算、为哪些未来查询、保留哪些信息形态”。
对 llm-wiki 来说,raw、source page、concept page、_index、log、wiki-vquery、ConversationSpec 都是在不同层做 memory compaction。若只靠 recency 或关键词频率,系统可能删掉/忽略未来关键但当下不显眼的证据;若什么都保留,又会制造检索噪音和上下文负担。
机制 / 一阶原理
论文的核心机制是把多个看似分散的技术统一为同一个抽象:
- Rate(资源成本):保留信息需要 token、KV cache、向量存储、数据库、检索延迟、人工维护成本。
- Distortion(任务损失):压缩或丢弃信息会降低未来任务的正确性、可追溯性、稳定性或恢复能力。
- Layer-agnostic compaction:KV eviction、prompt pruning、summary memory、long-term memory consolidation 都是在不同层做“保留/遗忘”决策。
- 保留信号的共同弱点:attention magnitude 与 recency 常被用作保留信号,但它们在 query 未知时会提前丢弃未来所需信息,且通常不可逆。
- repeated compaction 未被充分评测:agent 长期运行中会反复总结、筛选、压缩,但多数 benchmark 只测单轮 long-context compression。
一阶原理上,记忆压缩不应被视为美化摘要,而是一个带预算的决策问题:保留什么,必须由未来任务分布、可验证 provenance、恢复成本和错误代价共同决定。
和已有 wiki 概念的关系
- 对 Context-Engineering:补充“上下文不是越多越好,而是预算下的效用最大化”这一更严格的定义。
- 对 LLM-Wiki:wiki 页面是对 raw material 的人工/agentic compaction;应显式记录来源、写入记录和为何晋升。
- 对 Knowledge-as-Code:记忆压缩策略应版本化、可 diff、可测试,而不是隐式藏在 prompt 里。
- 对 Harness-Engineering:harness 应决定何时读 index、何时语义检索、何时读取 raw、何时只用 summary。
对 Hermes / llm-wiki 的可执行启发
- 把“晋升为正式页面”视为高保真 compaction:只有能长期复用、有机制深度、能链接既有概念的材料才晋升;浅材料留 raw/digest。
- 为检索噪音设置预算:wiki-vquery 结果不应无限扩张;需要 category/type filter、候选上限和证据路径。
- 记录丢弃理由:今日未入库候选不是垃圾,而是 compaction decision 的负样本;保留简短理由可帮助未来雷达调参。
- 避免只按 recency 更新:每日雷达不能只追最新日期;应优先保留能改变 workflow / verifier / harness 的知识。
- 评测 repeated compaction:定期抽样旧页面,检查 summary 是否丢失关键来源、是否仍能回答新问题、是否需要拆分或合并。
失败模式 / 边界条件
- 过度压缩导致 provenance 丢失:只留结论不留 raw/hash/来源,会让未来无法审计。
- recency bias:最近材料更容易被保留,但长期 foundational pages 可能更重要。
- 不可逆遗忘:一旦 raw 或细节被删除,未来新 query 可能无法恢复;因此 raw 层应保持 immutable。
- 预算轴不统一:token、latency、人工维护和错误风险不是同一单位,需要按任务类型权衡。
深度判断
晋升为正式 source page,因为它为 agent memory、context engineering 和 llm-wiki 页面晋升提供了统一的一阶原理:rate-distortion,而不是零散技巧。它能直接改进每日雷达的“少而深”策略、raw/source/concept 分层和检索预算。当前 confidence 设为 medium:已读取 arXiv 摘要页,尚未完整审查论文细节或实验。
写入记录
- 2026-07-11 09:00 CST:新增 memory compaction source page,提炼 rate-distortion 视角对 llm-wiki 分层、检索预算和 repeated compaction 评测的启发。