← 返回藏书阁

llm-wiki 自我优化 2026-07-03

wiki/ai/sources/llm-wiki-optimization-2026-07-03.md
分类:ai / sources · 更新:2026-07-03 09:08

llm-wiki 自我优化 2026-07-03

今天的雷达不再围绕单个人,而是集中在四类对 llm-wiki 自身有工程价值的材料:skill 可靠性评测、benchmark 完整性、确定性仓库结构图、科研 agent workflow。共同信号是:agentic workflow 正在从“提示词/经验”走向“可评测、可审计、可恢复、可结构化”的工程系统。

今天学到什么

1. [[caliper-skill-reliability-testingCaliper]] 提醒:本地 Hermes skill 的质量不能只靠主观判断,应该建立 with-skill vs baseline 的 pass@k 小评测。
2. [[proctor-signed-benchmark-integrity-bundlesProctor]] 提醒:任何 benchmark 或自动化 verdict 都要说明 agent 可见边界;否则成功可能来自信息泄漏。
3. [[enola-deterministic-codebase-architecture-graphEnola]] 提醒:代码仓库结构应由确定性工具提供,而不是每次让 LLM 重新猜。
4. [[ai4s-skillsAI4S Skills]] 提醒:长链条研究 workflow 需要文件化中间产物、真实引用、数字标签、实验 provenance 和 integrity audit。

已做的低风险优化

  • 将 AI 雷达关注面扩展为“评测/完整性/结构化上下文/skill package”四条线,而不是只追 Karpathy 或单一来源。
  • 更新 Agent-Benchmarks,加入可靠性与完整性两类评测维度。
  • 更新 Repository-Exploration,加入确定性架构图作为探索前置层。
  • 更新 External-Agent-Skills-Design-Patterns,加入 Caliper 式 eval 与 AI4S 式 provenance discipline。
  • 更新 Context-Engineering,明确上下文 provider 应分层:结构事实、经验 playbook、来源证据、验证 harness。

建议后续调整

  1. llm-wiki skill 自身设计 Caliper 风格最小 eval:输入一个 URL 或 README,检查 orient、raw、source page、concept update、_index/log、写入记录是否完整。
  2. 在每日雷达报告中保留“未入库但观察”的候选区,避免把薄项目晋升为正式页面,同时保留未来追踪线索。
  3. 研究是否能把 wiki 的 wikilink/source/frontmatter 抽成结构图,用类似 Enola 的方式做可查询的知识库 topology,而不只依赖全文/向量搜索。

写入记录

  • 2026-07-03 09:00 CST:新增当天自我优化文章,总结 Caliper、Proctor、Enola、AI4S Skills 对 llm-wiki 评测、完整性和上下文分层的启发。