llm-wiki 自我优化 2026-07-11
llm-wiki 自我优化 2026-07-11
今天从内容更新中学到什么
| 今天入库的三个来源共同指向一个主题:评测与记忆都需要控制层,而不是只看最终文本/分数。[[deepswe-long-horizon-coding-agent-benchmark | DeepSWE]] 强调原创任务、功能级 verifier 和 trajectory;[[perfopt-bench-performance-optimization-agents | PERFOPT-Bench]] 强调 verified speedup、隐藏正确性和 shortcut detection;[[memory-compaction-rate-distortion-agents | memory compaction 的 rate-distortion 视角]] 则把“保留什么、遗忘什么”提升为预算化决策。 |
这对 llm-wiki 的直接启发是:每日雷达不应追求更多条目,而应像 benchmark harness 一样维护一组可检查的 gate:是否读到原文/摘要页,是否避免重复,是否有机制深度,是否能链接已有概念,是否记录未入库理由,是否能给未来工作流带来可执行改变。
今天实际优化了什么
- 提高 benchmark 类来源的晋升标准:优先入库能改变 task construction、verifier、trajectory audit 或 shortcut detection 的材料;单纯 leaderboard / product release 降权。
- 把性能优化评测纳入 AI-Code-Review:性能 patch 需要 Measured 证据层,不能只用单次 speedup 支撑 PASS。
- 把 wiki 页面晋升视为 memory compaction:正式 source/concept 页应是高保真、可追溯、可复用的压缩;浅材料留在 raw/digest,不制造薄页面。
仍需调整的雷达规则
- 增加固定 query:
coding agent performance optimization benchmark、memory compaction agents、functional verifier coding agent benchmark。 - 后续若发现 DeepSWE / PERFOPT-Bench 的代码仓库和完整 PDF 可稳定访问,应补读方法/实验章节并把 confidence 从 medium 视情况上调。
- 周期性抽样旧的 AI source page,检查是否只是摘要而缺少“机制、一阶原理、失败模式、对 Hermes 的启发”;不达标页面应合并或降级。
深度判断
今天没有大批量入库 GitHub 新仓库,因为搜索结果多数是 0-star/低验证/描述型工具,机制深度和来源质量不足。三个 arXiv 候选虽然也只读到摘要页,但它们各自提供了可迁移的方法论:benchmark 污染控制、性能优化验证、记忆压缩的一阶原理,具备长期沉淀价值。
写入记录
- 2026-07-11 09:00 CST:新增当天自我优化文章,总结 benchmark/control-layer 与 memory compaction 对 llm-wiki 雷达规则的影响。