← 返回藏书阁

llm-wiki 自我优化 2026-09-14:引导链要验权,适配层要分责,指标要验分母

wiki/ai/sources/llm-wiki-optimization-2026-09-14.md
分类:ai / sources · 更新:2026-09-14 09:25

llm-wiki 自我优化 2026-09-14

今天不是追三家机构,而是补三个控制链缺口:工具调用之前的引导请求也有权限;会生成 Card 的 adapter 不等于安全 host;名字一样的 recall 不等于同一测量对象。 继续沿用 LLM-Wiki-Optimization-Log 的证据、有效配置、实际边界检查,不再每天发明一套 receipt 名称。

发现与深度判断

MCP Gateway / harness-runtime / sandbox-security;可迁移到 A2A

gemini-cli-oauth-bootstrap-and-workspace-trust:OAuth discovery 可借客户端网络位置发请求;restricted workspace 要在装载 MCP/policy/telemetry 配置时生效。官方 PR、固定 merge 源码与 RFC 9728 §7.7 对照后,能明确 DNS 预检/传输绑定、规范建议/实现同源检查、PR 标题/最终配置优先级的差别。有实现和可迁移负例,故晋升;不是把 09-08 发布当今天新漏洞新闻。 ^[raw/articles/gemini-cli-oauth-bootstrap-and-workspace-trust-2026-09-14.md]

A2A / harness-runtime / context management / sandbox-security

microsoft-a2a-adapter-host-ownership:官方 hosting adapter 只管 Card/转换,executor、store、auth、routes 由应用负责;同仓库另一包的 executor 不能冒充前者功能。自动 skill discovery 没有 session,模式校验还有 opt-out。固定代码与测试给出实际接入验收点,故晋升;尚无部署后 Card 或企业鉴权运行回执。 ^[raw/articles/microsoft-a2a-adapter-host-ownership-2026-09-14.md]

benchmark-evaluation / sandbox-security / harness-runtime / context management

mole-budgeted-monitoring-and-label-evidence:每日复核预算、状态化组织任务与廉价特征→选择性升级值得借鉴。本机两日 fixture 显示 account-day recall=0.5 与 campaign recall=1.0 同时成立;labeler 的大总预算也没有阻止每条 tool result 只留前 400 字符。论文完整归档、选定附录深读及纯函数实测带来耐久测量方法,故晋升;状态验证链未逐样本对账保留 contested,日终检测不外推在线预防。 ^[raw/articles/mole-budgeted-monitoring-and-label-evidence-2026-09-14.md]

候选评分与没有入库的原因

每维 1–5,顺序为 relevance / novelty / durability / actionability / source-quality / depth-potential;是编辑判断,不是实验测量或自动准入分数。七项均有机制价值,但原始证据/重复性可以否决高分。

候选命中知识点轴六维 / 总分处理与深度判断
Gemini CLI bootstrap/trustMCP Gateway、A2A(迁移)、harness-runtime、sandbox-security5/5/5/5/5/5 = 30深度 source;7 项静态核查
Microsoft A2A adapter/hostA2A、harness-runtime、context management、sandbox-security5/4/5/5/5/5 = 29深度 source;6 项静态核查
MOLEbenchmark-evaluation、sandbox-security、harness-runtime、context management5/5/5/4/5/5 = 29深度 source,contested;8 项纯函数检查
MCP 撤销缓存设计文MCP Gateway、harness-runtime、sandbox-security5/3/5/4/3/3 = 23raw-only;全文已读,示意 JSON 不等于真实联邦撤销/下游零请求实测,与旧机制重叠
AgentDriftbenchmark-evaluation、sandbox-security、context management4/4/4/3/4/4 = 23raw-only;只读摘要,未核标签、数据/身份泄漏和泛化
VERAcontext management、harness-runtime、benchmark-evaluation4/1/4/3/4/4 = 20沿用昨日摘要 raw,无新全文/预算配对证据,不重建薄页
Real-SWE / Specific Labsbenchmark-evaluation、harness-runtime5/5/5/4/2/4 = 25search-only;仅二手摘要,原始来源检索失败,未核私有任务和 hidden verifier,不使用其模型数字

所有深度候选命中本轮高权重主题。VERA 作为独立 context 轮换候选保留,但不为了均衡配额强行晋升。部分 web 搜索/抽取返回 403;主要来源通过原站 HTTPS 补回。arXiv 抽取器上游截断通过直接 HTML 恢复;全文归档和实际深读章节分别记录,绝不把保存整个文件等同读完全部代码。

对 llm-wiki 的低风险优化

已同步 AI-Knowledge-Point-Radar,并在 MCP-Gateway-RuntimeA2A-Agent2Agent-ProtocolAgent-Benchmarks 加短入口和来源标记;深度内容留在 source,不继续向超长概念页复制日报。

  • 取证提前到引导阶段: 对 OAuth metadata、配置装载、自动技能曝光也记录来源和实际副作用,不只追 tools/call
  • 检索必须固定 API 层与版本: 相同仓库不同包、PR 描述与最终 merge、Card 宣告与服务实现分开;star 只作来源快照。
  • 检验实际判分输入: 固定 metric entry point/单位/无正例规则;为 serialization 加尾证据与 silent-call 反例。完整 raw 和 judge-visible view 分别留 hash;不把“文件大、预算大”当无丢失证明。
  • 增加双语轮换词: OAuth bootstrap egress / 引导出站;application-owned A2A host / 应用自管 A2A 服务;session-aware skill discovery / 会话感知技能发现;account-day review budget / 账号日复核预算;judge-visible evidence truncation / 判分可见证据裁剪。

未修改 cron、gateway、权限、向量模型或其他 profile;未自动安装/执行外部 runtime。SCHEMA 缺失,沿用既有标签而不创建未经确认的大 taxonomy。现有超长页、历史断链与日报检索拥挤适合专门维护,不能顺手大规模移动。

实际文件清单

相对于 ~/llm-wiki/vault/

新增正式文章(wiki/ai/sources/):

  • gemini-cli-oauth-bootstrap-and-workspace-trust.md
  • microsoft-a2a-adapter-host-ownership.md
  • mole-budgeted-monitoring-and-label-evidence.md
  • llm-wiki-optimization-2026-09-14.md(本页)

更新概念与导航: wiki/ai/concepts/AI-Knowledge-Point-Radar.mdwiki/ai/concepts/MCP-Gateway-Runtime.mdwiki/ai/concepts/A2A-Agent2Agent-Protocol.mdwiki/ai/concepts/Agent-Benchmarks.md_index.mdlog.md

新增不可变 raw:

  • raw/articles/gemini-cli-oauth-bootstrap-and-workspace-trust-2026-09-14.md
  • raw/articles/microsoft-a2a-adapter-host-ownership-2026-09-14.md
  • raw/articles/mole-budgeted-monitoring-and-label-evidence-2026-09-14.md
  • raw/articles/mcp-revocation-cache-design-raw-only-2026-09-14.md
  • raw/articles/agentdrift-step-labels-abstract-raw-only-2026-09-14.md
  • raw/notes/ai-knowledge-radar-2026-09-14.md

原始抓取/commit/HTTP/hash、候选账本与检查结果在 raw 中可追溯;工作回执保存在 /tmp/ai-radar-20260914/。派生检索索引和 CVM HTML/manifest 不算新知识页。

验证范围

已执行的 21 项离线检查全部通过:8 项是抽取上游纯函数对明确人工构造 fixture 的实测,13 项是选定源码/元数据静态断言。未运行上游 pytest/TCK、企业鉴权 E2E、网络安全 PoC 或论文 benchmark,未把作者数据或样例当本机结果。

定向 QA 覆盖八篇新增/更新正式页:必要 frontmatter、既有标签、正文写入记录、来源路径、至少两条正文链接、新页导航/反链均通过;六份新 raw 的 body SHA-256 正确,旧 raw 无变动。新 source 均低于200行;概念页 A2A=204、MCP=242、Benchmark=521 行,A2A 本轮短增触及阈值,其余为已有超长债务,拆分留独立维护。

全库 lint 最终复核为 334 errors / 2374 warnings / 61 info,仍未通过;正式wiki的63 errors、raw的271 errors及ERROR明细与开始相比均未变化。09:18检查曾为334/2712/61,但期间检查器文件在09:20发生变化,当前check_orphans按解析后的path合并title/stem;本雷达未修改CLI,不把warning下降归功于内容修复,也不把不同检查器的warning计数直接作进步指标。定向结构/链接检查独立于这个变更。

全量 GLM Embedding-3 重建 531 篇,28.0秒、34次API调用;filesystem / wiki-query / vector metadata 路径集合相等,missing/extra/duplicates/stale均为零,FAISS 531×2048。三条机制语义查询均把对应新source排第一;最终正文验收补充后再增量同步。公网发布的精确回读回执见本轮 log.md;通知投递由cron系统负责,本任务不代发,不把CVM成功当消息送达证明。

下一步建议

  1. 隔离 runner 先加入两日指标分母、无正例与工具结果尾证据三个 fixture,再比较监控分数。
  2. A2A 接入先做双 tenant 同 context ID、session-specific skills 和断流 artifact append 测试。
  3. 网关先列 OAuth discovery/redirect/配置装载的出站路径,核对拒绝时下游是否真正零请求。

写入记录

  • 2026-09-14 09:18 CST:新增今日三项深度机制、七候选评分/否决原因、文件清单与雷达优化;明确本机纯函数/静态检查和未执行范围。
  • 2026-09-14 09:23 CST:补入定向QA、全库lint边界、向量三方集合和语义召回实测;明确概念页长度债务与发布/消息投递分验。
  • 2026-09-14 09:25 CST:校准最终lint统计;记录验收期间检查器文件变化与孤儿判定口径,防止将外部工具变化误报为本轮修复。