← 返回藏书阁

llm-wiki 自我优化 2026-09-16:状态可信、后台分权与失败分母

wiki/ai/sources/llm-wiki-optimization-2026-09-16.md
分类:ai / sources · 更新:2026-09-16 12:04 最近更新

llm-wiki 自我优化 2026-09-16:状态可信、后台分权与失败分母

今天学到什么

结论:状态迁走,不等于责任消失;测试存在,不等于业务链路走完;可判分成绩,不等于所有任务的交付表现。 今天沿知识点轴深挖三组材料,不按人物、发布日期或来源数量凑页。

知识点轴内容与深度判断实际证据边界
MCP Gateway / harness-runtime / sandbox-securitymcp-mrtr-state-and-header-integrity:无状态请求如何保留身份、完整性与一次性消费约束;可直接转为网关负例版本化规范全文;四个编码例复算,非网关E2E
A2A / harness-runtime / sandbox-security / benchmark-evaluationa2a-redis-owner-dispatch-and-test-boundaries:caller过滤和后台fan-out分权;区分API注册与直接store预置Open PR固定源码;方法级内存fixture复现分隔符缺口,非Redis/认证运行
benchmark-evaluation / context management / harness-runtimesre-bench-hidden-grader-and-coverage:隐藏grader、污染控制和拒绝/context失败分账完整论文/原表复算;非模型实验、非sandbox安全成功率

为什么这些是长期机制而非短新闻

MRTR规范明确回传 requestState 受攻击者控制,影响授权/业务时须保护完整性;principal/TTL/请求绑定仍不自动实现single-use。wiki需保存义务对象、规范版本、MUST/SHOULD与验收状态,而不把“支持协议”当成实现证据。^[raw/articles/mcp-mrtr-state-and-header-integrity-2026-09-16.md]

a2a-redis示例的bob配置直接入store,身份由测试header注入。对应代码能证明fan-out结构,但不覆盖真实任务共享授权。wiki读测试时应标注输入从哪里进、绕过什么边界、是否skip、本地到底运行哪部分;“E2E”文件名不可直接晋升证据等级。^[raw/articles/a2a-redis-owner-dispatch-and-test-boundaries-2026-09-16.md]

SRE-Bench把拒绝/context超窗排除在均值外;最强模型80/254完全成功,在全计划262实例上为30.53%。后续评测记录统一用已有planned/covered/correct框架扩展结束原因,不再造日报专属计分体系。^[raw/articles/sre-bench-hidden-grader-and-coverage-2026-09-16.md] ^[raw/notes/ai-radar-evidence-checks-2026-09-16.md]

本轮低风险优化

同步 AI-Knowledge-Point-Radar 的三条既有检查:

  1. 证据层级:规范/固定PR/方法fixture/端到端运行分开;pending PR不变成正式产品事实。
  2. 对象与配置:记录wire protocol与SDK版本、caller与dispatcher、planned与gradeable;条件分数不隐去拒绝或资源失败。
  3. 实际边界:关注不可信回传状态、后台隐式权限、fixture直接预置,以及组合键/参数编码后的真实对象。

新增双语轮换词:MRTR requestState integrity / 多轮请求状态完整性header-body agreement / 头体一致性owner-scoped dispatch / 按所有者隔离与后台分发fixture authorization bypass / 测试预置绕过授权gradeable coverage / 可判分覆盖率。MCP/A2A/安全仍最高优先,SRE补context失败机制而非挤掉独立context研究。

低风险动作限于本文、Radar、MCP-Gateway-RuntimeA2A-Agent2Agent-ProtocolAgent-Benchmarks 的短导航、来源归档和索引/log;没有修改cron、gateway、权限、其他profile或引入本地模型。LLM-Wiki-Optimization-Log 保持稳定汇总职责,不再复制一遍今天长摘要。

哪些没有晋升

  • STOA ADR046(MCP Gateway / harness-runtime):已读Draft,partner跨IdP federation明确不在范围;未核实现,raw-only。
  • A2A builder guide(A2A / harness-runtime):教程可读,但与已有协议/发现/任务内容重复;留raw作入口,优先分析实际PR接缝。
  • PRIMUS(harness-runtime / sandbox-security / benchmark-evaluation):只读摘要;部分artifact按需或受控,全文/实现/结果未核,raw-only。数字不进入正式概念结论。
  • 其他computer-use/sandbox搜索候选本轮未补到足够原始证据,不强行宣称新突破;也不将SRE当容器逃逸测试。

访问限制:GitHub部分API403,改用HTML和固定raw源码;再次git remote查询超时。MCP缓存文档候选404,未据此建页。取证范围与失败HTTP回执随raw保存,不假称全部来源可访问。

下一步建议(未自动实施)

  1. MCP:隔离mock加入篡改/换主体/过期/双消费、头体冲突与400降级负例;不先动生产网关。
  2. A2A:把同一multi-owner场景改成真实API注册与已验证身份,加入带分隔符owner、撤销/TTL、webhook出站测试;不要直接把demoheader当认证。
  3. 内部benchmark:输出planned/gradeable/solved和拒绝/context/超时原因,费用统计覆盖所有run;同时保留reference与伪解负例验证。

旧概念长页、全库断链/缺SCHEMA、日报检索拥挤属于专项维护;今天只做新增差集校验,不借雷达批量重构。验证与发布实测结果追加到 log.md,不得在执行前标记成功。

写入记录

  • 2026-09-16 09:19 CST:新增今日三组机制综合、降权理由和双语轮换词;复用既有gate,区分本机方法测试与真实E2E。
  • 2026-09-16 09:26 CST:按实际文件创建时间校正首次写入记录。
  • 2026-09-16 12:02 CST:汇总巡检补齐 MCP/A2A/Benchmark 三个主题簇正文 wikilink,替换无链接的“三个主概念”表述;不改早报技术结论或证据等级。