← 返回藏书阁

llm-wiki 自我优化 2026-07-21

wiki/ai/sources/llm-wiki-optimization-2026-07-21.md
分类:ai / sources · 更新:2026-07-21 09:12

llm-wiki 自我优化 2026-07-21

今日从内容更新学到什么

今天入库的四个材料共同指向一个主题:agentic engineering 正在从“让 agent 做事”转向“让 agent 在可评分、可观测、可交接、可恢复的工程表面上做事”

- [[flow-next-agentic-engineering-workflowFlow-Next]] 强调 repo-native artifact chain:spec、task、fresh worker、cross-model review、receipt。
- [[harness-score-maturity-scannerHarness Score]] 把 repo harness 结构成熟度变成 deterministic scanner,而不是只靠主观 review。
- [[nemo-relay-agent-runtime-controlNeMo Relay]] 把 agent run 变成可导出的 raw events / normalized trajectories。
- [[fastcontext-read-only-repository-explorationFastContext]] 把 repository exploration 从主 agent 上下文中分离出去,并要求返回 cited compact answer。

这说明 llm-wiki 自身的改进方向不应只是“多发现几个源”,而是把每日 radar 变成可观测、可评分、可复盘的 workflow:发现路径、候选筛选、raw 保存、页面晋升、概念更新、索引日志、向量重建、最终报告都要有轻量 receipt。

已做的低风险优化

  1. 本次 radar 明确以 GitHub/README 高价值工程项目为发现路径,没有收敛为 Karpathy 单点追踪。
  2. 对四个晋升 source 页都补齐了:为什么重要、机制/一阶原理、关系、可执行启发、失败模式、深度判断、写入记录。
  3. raw README 均保存到 raw/articles/,并带 source_url、ingested、sha256 frontmatter,便于后续 drift 检查。
  4. 本次候选选择更重视“可迁移工程机制”:artifact chain、deterministic maturity scan、runtime trajectory、read-only cited exploration,而不是只看 star 或热度。
  5. 今日报告会明确说明未入库项和原因,避免把低信号发现包装成知识沉淀。

应如何调整雷达

  • 新增关注关键词/项目簇:repo-native receipts、agent workflow artifacts、harness maturity scanner、agent trajectory runtime、read-only repository exploration、citation validation、scope-aware agent runtime、fresh-context workers。
  • 候选评分加一项 observability:一个工具/论文是否让 agent 行为更可观测、更可复查、更可打分,应成为 durability/depth-potential 的加分项。
  • 将 radar 自身做成 maturity checklist:每天自动检查 raw sha256、写入记录、_index/log 更新、wikilinks、reindex 状态、访问失败记录。
  • 后续优先做 comparison:Flow-Next、Harness Score、NeMo Relay、FastContext 属于不同控制层,后续可写 “agent workflow control stack” 对比页,区分 spec artifact、static scanner、runtime relay、read-only explorer。

仍待改进的问题

  1. _index.md 的 AI 来源单行已经过长;今天只做低风险追加,后续应按主题拆分为 context/harness/benchmark/security/tools 子段。
  2. GitHub API 今天出现 rate limit;后续 radar 应减少高频 GitHub Search API 调用,优先 raw README / releases / curated topic 轮换,或做本地去重缓存。
  3. 本次四个项目主要基于 README,尚未实测;source 页均标 confidence: medium,后续若用户要采用,应安排一次实际安装/运行验证。
  4. NeMo Relay / Harness Score 可能直接适合测试 Hermes 或某个代码库,但引入前需要确认 side effects、数据敏感性和依赖范围。

写入记录

  • 2026-07-21 09:01 CST:新增当天自我优化文章,归纳 artifact chain、deterministic harness scoring、runtime trajectories 和 read-only cited exploration 对 llm-wiki radar 与 Hermes 工程实践的启发。