← 返回藏书阁

LLM Wiki Optimization Log

wiki/ai/concepts/LLM-Wiki-Optimization-Log.md
分类:ai / concepts · 更新:2026-09-17 12:06 最近更新

LLM Wiki Optimization Log

定位与结论

本页是稳定机制总览,不是按日期追加的第二份日报。最近汇总窗口为 2026-09-11 至 2026-09-17:沿同一控制链,以证据等级、对象/时间/配置/分母、真实权限与状态三条检查横切各环节。当前收敛点是:需求覆盖须追到独立事实,自编测试不能自证;反馈暴露、预算与统计单位须分账;托管错误、健康信号和业务终态不能互相代替。既有状态完整性、后台分权、测试入口、未判分成本及授权/恢复/评分边界继续有效。

这些规则已沉淀为 wiki 内容维护与候选判断准则;不等于 Hermes 已部署强制权限网关,也不等于外部项目已经本地测试通过。项目有效性仍受版本、部署和证据范围限制,故综合置信度为 medium。运行审计留在 log.md,不在本页反复复制“今日检查正常”。

当前机制基线

  • 知识点优先AI-Knowledge-Point-Radar 按 MCP Gateway / A2A / harness-runtime / context management / benchmark-evaluation / sandbox-security 六轴选择内容;Karpathy 等人物、组织、平台只作 seed。
  • 少而深的晋升:依据 relevance、novelty、durability、actionability、source-quality、depth-potential 判断;高分但重复、对象不明、只有搜索摘要的候选仍可 raw-only 或不入库。不是每个候选都必须实现下面所有控制环节。
  • 发现与证据分开:web search 优先发现,随后读取原文/代码;抓取失败可换直接 HTTPS、官方 API 或可靠镜像。未读到的部分必须明确,不以搜索摘要冒充全文。
  • 原文完整性先于编译:文件存在、HTTP 成功与 body hash 只能证明拿到且固定了这些字节,不能证明全文齐全。检查上游截断标记、末节/附录和原始页面;未完整取得时标记实际读取范围,不能让缺失内容经摘要变成确定结论。参见 arc-addressable-recall-context-compaction。^[raw/articles/arc-addressable-recall-context-compaction-2026-09-11.md]
  • 内容分层与候选生命周期:raw 不改;每日 source 保存当时观察,稳定结论更新本页与归属概念页。后续补读/晋升写入新的 source、候选账本与 log,保留原 raw-only 的历史语义;当前待办须按后续证据更新,不能永久复制过期阻塞。harbor-index-parity-task-validity-and-snapshot-boundaries 是复用旧 raw 后晋升的案例。普通入库不另造机制名称。

一条控制链,而不是每天一套分类

资产/能力发现 → 信任与协议绑定 → runtime 装配与任务规划 → 路线选择与动作授权 → 任务恢复与独立状态 → 长程评测与反馈

环节最小可复核信息与失败判定机制归属与证据入口
资产与能力发现asset_type、owner、schema/card hash、scope/discovery filtering、health、registry diff、last_seen、撤销/隔离、federation source trust;目录存在不证明能力可用MCP-Gateway-RuntimeA2A-Agent2Agent-Protocolagentic-community-mcp-gateway-registry-ai-asset-control-plane
信任与协议绑定human/agent/job identity、实际端点的 Card hash/抓取时间、service version 与 protocolVersion、supportedInterfaces、effective capabilities、transport/extension/auth/signature、compat mode、endpoint probe;发现、认证、组织准入、用户策略和资源权限分验A2A-Agent2Agent-Protocolatlassian-rovo-a2a-live-card-and-enterprise-gatesa2a-v1-protocol-binding-governance
装配与任务规划capability snapshot、mount/unmount、stale rejection;task envelope、context refs、data classification、tenant trust、mutation impact、预算/截止时间、幂等键、runtime placement、SandboxClaim、decision hash;计划回执不证明执行Harness-EngineeringMCP-Gateway-Runtimedsh-nacos-bridge-registry-to-harness-runtimeagentmesh-runtime-gateway-task-envelope-sandboxclaim
路线选择与动作授权inventory、distractor、selected route、GUI/tool fallback、TIR、成本;normalized action、matched rule、allow/review/block、approval/consent、scoped credential、fail-safe、旁路与审计;提示遵守不等于强制拦截osworld-mcp-tool-invocation-computer-use-benchmarkaegisflow-local-first-policy-gatewayagenttrust-runtime-safety-interception
任务状态与恢复TaskHandle、pending input/auth/approval、poll/stream/push reconcile、artifact、wire/trace、事件/采样时间、独立业务状态;历史可查、执行接管、幂等、host健康与任务完成分验A2A-Agent2Agent-ProtocolContext-Engineeringa2a-query-task-handle-approval-brokera2a-jakarta-cross-node-state-and-effective-securityaws-agentcore-a2a-host-contract-and-health-semantics
长程评测与反馈horizon、模型/harness/gateway/题目版本、attempt independence、parity/oracle/正反例、reset/handoff/grade/reward/release、trace/token/cost、内层预算/外层截止;任务/环境/agent 归因、integrity、coverage 分账Agent-BenchmarksHarness-Engineeringswe-marathon-ultra-long-horizon-agent-benchmarkbenchshield-reward-lifecycle-integrityharbor-index-parity-task-validity-and-snapshot-boundaries

三条横切检查:声明、控制与观测不能混同

1. 证据等级与实际覆盖

分别标记:搜索发现 → 完整原文 → 固定版本源码/具体 assertion → 真实运行回执。A2A 接入保存规范条款、测试函数、断言、运行对象及 declared / applicable / executed / passed;未实现、人工验证、前置失败、可选不适用分别给原因,业务必需能力不能靠不声明免验。测试文件、作者回执、本机 hash 核查与本机 verifier 重放不能混同:a2a-tck-conformance-coverage-and-security-boundaries 约束覆盖口径,a2a-output-attestation-and-delegation-ancestry 的归档核查不证明本机验签通过。^[raw/articles/a2a-tck-conformance-coverage-and-security-boundaries-2026-09-10.md] ^[raw/articles/a2a-output-attestation-and-delegation-ancestry-2026-09-11.md]

测试入口也是证据边界:逐条列出真实 API 注册、直接 store 预置、身份注入、实际 IdP、skip 与本机运行范围。a2a-redis-owner-dispatch-and-test-boundaries 的 bob 配置直接入 store,只支持预置后的 fan-out 结论,不证明注册/任务共享获授权;方法级内存 fixture 不升级为 Redis、HTTP、加密或认证 E2E。未合并 PR 仍记分支状态,不作为已发布产品事实。^[raw/articles/a2a-redis-owner-dispatch-and-test-boundaries-2026-09-16.md]

对 llm-wiki 的应用:候选记录保留 URL、fetch_status、判分/否决理由、raw_path、body sha256、page_paths 和验收位置。候选记录是审计,不自动提升证据等级;已有 raw note 可承载,不要求马上新建复杂 registry 或 radar-gates.yaml

需求覆盖不能由自编测试自证:按“主张—原始来源/版本—适用条件/反例—未知”追证据;搜索只负责定位,不能以次数代替完整必要段落或事实覆盖率。hyper-tau-bench-evidence-recovery-and-agent-construction 提醒:摘要、实现和自编测试可能复制同一误读,应另设独立验收清单并先测继承代码 baseline。没有事实全集不报覆盖百分比;提问与高分的观察相关不作因果规则,cron无人时保留未知,不模拟用户决定。^[raw/articles/hyper-tau-bench-evidence-recovery-and-agent-construction-2026-09-17.md]

案例与规范分轨:新论文或部署案例可提供架构机制,但发表更晚不自动取代仍适用的规范。记录标准状态、条款和适用对象,遇到冲突保留原文并在 source 标记 contested,只晋升不冲突的机制。enterprise-mcp-persona-credential-boundaries 的身份矩阵可借鉴,ROPC 却受 RFC 9700 §2.4 的 MUST NOT 约束,没有机器身份例外;本次依据归档的完整选定章节,不冒称重读完整 RFC 或实测部署。^[raw/articles/enterprise-mcp-persona-credential-boundaries-2026-09-12.md] ^[raw/articles/rfc9700-oauth-security-selected-sections-2026-09-12.md]

2. 对象、事件时间、配置与分母

记录 publication/fetch/version/commit/config 和结论适用的对象;读 issue 后续评论与 release,不能把旧版本缺陷、同名产品或协议规范当当前部署事实。A2A 旧 SDK ownership 报告与 1.0 修复说明必须区分;这不是对当前 SDK 的独立安全审计。^[raw/articles/a2a-tck-conformance-coverage-and-security-boundaries-2026-09-10.md]

有效配置覆盖默认声明:分列 SDK default / demo override / test fixture / deployed config,记录配置来源、优先级和关闭的具体校验。a2a-jakarta-cross-node-state-and-effective-security 中 fail-closed 公告与示例 a2a.authorization.required=false 同时成立;多租户 fixture 还设置 org.a2aproject.sdk.transport.skipValidation=true。路由测试不能冒充租户授权或全部 transport 验证,静态断言不能冒充运行通过。^[raw/articles/a2a-jakarta-cross-node-state-and-effective-security-2026-09-13.md]

健康信号须绑定来源与事件时间:保存callback结果/异常、fallback、session状态、状态变化时间与探测时间。aws-agentcore-a2a-host-contract-and-health-semantics 的固定SDK在callback异常时回退Healthy,不能据此推出业务健康;HealthyBusy参与保活,time_of_last_update不能每次ping刷新为当前时间,否则可阻止idle timeout。回退是否导致提前回收仍须真实部署验证;AST替身结果不当云端生命周期实测。^[raw/articles/aws-agentcore-a2a-host-contract-and-health-semantics-2026-09-17.md]

先验题目,再比较 agentharbor-index-parity-task-validity-and-snapshot-boundaries 要求先核参考解、需求与 verifier 对齐、合法替代解、伪解负例及答案可见域。移植前后固定 task IDs、模型/harness/toolset/预算与子集选择;误差条近似相符不等于严格统计等价。修题后重跑同一 cohort,并保留旧版;论文、博客、当前 main 的题量/运行数/成绩不能拼成单一快照,未对账处保留 contested。低分还可能来自坏题、环境或评分器,不直接归因为能力不足。^[raw/articles/harbor-adapters-harbor-index-2026-09-12.md] ^[raw/articles/harbor-index-curation-parity-and-version-snapshots-2026-09-13.md]

指标语义与历史状态分账:保留 cohort、条件分母、轨迹和判分配置;选择性失败重放不代表全任务安全提升。按动作事件时间关联当时权限/状态,不用 current/latest 代替历史,识别规则也不等于执行遵守(redagentbench-state-grounded-safety-measurement)。可恢复、选中/消费、提交、正确及合法效用/执行覆盖分别记账;arc-addressable-recall-context-compaction 的 correctness/completion 与 spa-plan-first-label-preserving-persistent-agents 的总数/utility 疑点保留 contested,不传播为选型结论。^[raw/articles/redagentbench-state-grounded-safety-measurement-2026-09-10.md] ^[raw/articles/arc-addressable-recall-context-compaction-2026-09-11.md] ^[raw/articles/spa-plan-first-label-preserving-persistent-agents-2026-09-11.md]

弃权分母与成本不能消失:沿用 planned → runnable → covered → correct,按任务注明 started/gradeable/solved 的映射、统计单位和排除原因;并列覆盖率、条件成绩与全计划交付比例,不把它们当同一指标。benchshield-reward-lifecycle-integrityInconclusive 不能并入通过;静态暴露、实际使用禁止路径、语义充分性分别判定。sre-bench-hidden-grader-and-coverage 进一步要求拒绝/context overflow/infra/timeout 分列、所有 run 的费用留账,避免只对可判分样本平均。拒绝须另核授权/安全标签,context 失败不当安全成功;rubric 平均分不当实例完成率,也不将逆向分析成绩外推 sandbox 防御率。^[raw/articles/benchshield-reward-lifecycle-integrity-2026-09-12.md] ^[raw/articles/sre-bench-hidden-grader-and-coverage-2026-09-16.md]

允许反馈与计分口径显式分层:保存pilot子集、反馈次数、是否仍计分、raw quality、预算罚项、task-macro/conversation-micro、领域权重及build/serve成本。hyper-tau-bench-evidence-recovery-and-agent-construction 允许部分pilot反馈且样本仍在scored suite,不可笼统称全样本隐藏,也不据此认定作弊;含预算惩罚的任务宏平均不是会话成功率,ground-truth reference不是平均人类成绩。缺逐trial数据时不补造分组效果或误差条;纸面隔离说明不当沙箱防御证据。^[raw/articles/hyper-tau-bench-evidence-recovery-and-agent-construction-2026-09-17.md]

固定指标入口与可见证据mole-budgeted-monitoring-and-label-evidence 提醒保存 metric 的 commit/entry point、排名单位、正例单位、每日预算、时间窗及 no-positive/NaN 规则;account-day 与 campaign 的 recall 不可仅凭同名混用。人审次数不等于独立案例数,检测成本须注明排除项。对内部 runner 先用两日/无正例 fixture 锁定口径;日终检测不外推在线阻断,同日全量特征不能未经修改用于动作前判定。^[raw/articles/mole-budgeted-monitoring-and-label-evidence-2026-09-14.md]

完整归档不证明 judge 看全:保存不可变原件与 judge-visible view 的各自 hash、序列化版本及裁剪规则;用工具结果尾证据、参数尾证据、silent tool call 验证不同字段的保留行为。大总预算不能抵消逐条裁剪;transcript labeler 与独立 service-state truth 分验,未逐样本对账保留 contested。早报的纯函数 fixture 只证明所测代码行为,不证明发布数据误标;本汇总未重跑这些函数或论文实验。^[raw/articles/mole-budgeted-monitoring-and-label-evidence-2026-09-14.md]

先验模型实际输入,再解释分数:固定 dataset/runner/adapter/formatter/metric 的版本和 hash,先做 schema smoke,确认用户目标、工具返回及隐藏字段映射。topbench-compositional-privacy-and-harness-integrity 的旧 runner 字段与当前数据不相容,工具 ID 又有可见角色信号;删除标签字段不等于没有捷径。保存 agent-visible 快照,中性 ID/顺序随机化须配对重跑;结构一致、两集精确无交集不证明语义条件、训练无污染或模型实际利用,未确认论文入口时保留 contested。^[raw/articles/topbench-compositional-privacy-and-harness-integrity-2026-09-15.md]

3. 实际权限闭包与独立结果

验证 caller × tool × destination × delegated service:session 不是身份;token 不外发不代表目的地受限;修复版本与可选认证配置必须分别验收。MCP 后端服务账号与网络位置本身也是可被借用的权限,参见 grafana-mcp-session-identity-and-egress-boundaries。^[raw/articles/grafana-mcp-session-identity-and-egress-boundaries-2026-09-10.md]

策略与执行对象必须一致:将 caller/tenant、route、session 恢复 backend、policy 版本及下游最终 URI/身份放在同一回执中;连接恢复和删除路径都要绑定对象。agentgateway-session-policy-and-inspection-boundaries 的 backend-group 修复不证明同组路由、撤销或动态策略全安全;MCP→REST 的编码/头优先级须核后端实际所见,不能只看代理状态码。^[raw/articles/agentgateway-session-policy-and-inspection-boundaries-2026-09-15.md]

无状态不等于无安全状态mcp-mrtr-state-and-header-integrity 的回传 requestState 必须当作攻击者可控;影响授权/资源/业务时 MUST 保护完整性并拒绝验证失败,principal/TTL/请求绑定为 SHOULD,要求最多使用一次时另由服务端强制。签名或 TTL 不替代 single-use/业务幂等。网关按 Header 决策、后端按 Body 执行须按适用协议校验解码后的同一对象;现代校验错误不能触发盲目降级。记录规范版本、义务对象与 MUST/SHOULD,不将规范或编码例复算当网关验收。^[raw/articles/mcp-mrtr-state-and-header-integrity-2026-09-16.md]

检查前提先于策略谓词:完整 body、合法格式、可解析字段是相应内容规则的前提;缺失/超限/解析失败不能被否定式规则当作“未违规”,须明确拒绝/复核。前缀只支持前缀范围的判断。release 的 truncatedBody 与固定实现的 body_prefix 文案冲突留 source,不拼造已测配置;后续 mock 同时核拒绝原因和下游请求数,本汇总未运行网关或 PoC。^[raw/articles/agentgateway-session-policy-and-inspection-boundaries-2026-09-15.md]

引导请求同样借权:将 OAuth discovery/metadata/redirect、仓库配置装载纳入执行前权限面,而非只审 tools/callgemini-cli-oauth-bootstrap-and-workspace-trust 要求分别记录配置来源/优先级、被验证地址、实际连接/逐跳目标和拒绝时下游请求;DNS 预检不证明传输绑定,PR 标题不覆盖最终 merge,规范 SHOULD 不改写为所有服务同源的硬要求。此处是接入审查规则,未对用户网络执行 PoC 或加固。^[raw/articles/gemini-cli-oauth-bootstrap-and-workspace-trust-2026-09-14.md]

授权先于借权:分别记录 initiated-by、actor/workload 与 executed-as;User→SA 必须在附加服务账号凭证前核验 caller × SA × action × destination × tenant,并保存当时策略与拒绝点。交互用户、cron 工作负载和下游执行身份不能混同。Token exchange 的历史 act 不证明逐跳同意,输入 token 撤销也不自动传播;token 角色、audience 与撤销合同须按部署分别验证。参见 enterprise-mcp-persona-credential-boundariesMCP-Gateway-Runtime。^[raw/articles/enterprise-mcp-persona-credential-boundaries-2026-09-12.md] ^[raw/articles/rfc8693-token-exchange-selected-sections-2026-09-12.md]

发现、调用与逐跳凭据分验:绑定实际 Card/metadata、protocolVersion 和有效能力,而非注册声明。atlassian-rovo-a2a-live-card-and-enterprise-gates 的公开 GET 不代替组织/用户/资源授权;foundry-apim-a2a-discovery-and-credential-hops 还要求分开 client/server 方向、Card fetch/invocation、入口 caller/出口 managed identity、外层 Responses stream/远端 A2A SSE。Card 带凭据选项只属于对应 client,并受 HTTPS/同 host 约束,不能跨产品套用。教程 405 不泛化为产品缺陷,XML 解析不冒充部署 E2E;断流/超时后重试副作用动作前仍回查 task、独立状态与幂等键。^[raw/articles/atlassian-rovo-a2a-live-card-and-enterprise-gates-2026-09-12.md] ^[raw/articles/foundry-apim-a2a-discovery-and-credential-hops-2026-09-15.md]

adapter 不替 host 履责:按具体包/API/commit 列出 Card、转换、executor、store、auth、routes、session 的所有者,不把同仓库另一包的功能移接过来。microsoft-a2a-adapter-host-ownership 的无 session 技能发现不证明租户可见性安全;默认模式校验还须核 opt-out。接入分别验证 tenant/context/session/task/artifact 键、真实 binding、稳定 artifact append 与断流对账;这些检查不互相替代,也不从样例推出恢复或取消副作用保证。^[raw/articles/microsoft-a2a-adapter-host-ownership-2026-09-14.md]

caller 与后台 dispatcher 分权:用户读取保持 owner 隔离,内部跨 owner 分发只面向该任务已授权订阅者,不能用“无当前用户”代替服务权限。注册、发送时有效授权、撤销/TTL/删除索引及 webhook 出站分别验;组合键必须可逆或明确限制输入。a2a-redis-owner-dispatch-and-test-boundariesorg:alice 反例只证明固定方法/合成输入下的分隔符缺口,尚未验证真实身份可达性,不升级为生产漏洞结论。^[raw/articles/a2a-redis-owner-dispatch-and-test-boundaries-2026-09-16.md]

观察恢复不等于执行恢复:共享task DB、广播事件、执行接管、业务幂等与取消分别验。a2a-jakarta-cross-node-state-and-effective-security 中B只观察,执行仍在A。托管错误另保留HTTP status、可解析错误体、message、request/session ID与retry reason;AgentCore两类409不能仅按状态码或JSON-RPC code判同一类重试。提交后504须回查业务状态/幂等键,202须追异步终态,200列表须核分页/投影滞后;不能“错误即重放”或“响应即完成”。这是后续隔离负例合同,本汇总未运行云端/业务恢复测试。^[raw/articles/a2a-jakarta-cross-node-state-and-effective-security-2026-09-13.md] ^[raw/articles/aws-agentcore-a2a-host-contract-and-health-semantics-2026-09-17.md] ^[raw/articles/hyper-tau-bench-evidence-recovery-and-agent-construction-2026-09-17.md]

沙箱还须纳入本地 daemon、Unix socket、loopback、宿主共享和代理执行。直接进程被限制,并不证明边界外的服务不能代行;socket 存在也不等于可利用。参见 pillar-docker-socket-sandbox-trust-handoffaisi-sandboxescape-bench-container-breakout。本轮未探测用户部署或执行漏洞 PoC。^[raw/articles/pillar-docker-socket-sandbox-trust-handoff-2026-09-10.md]

评分链路也要验收:独立 verifier 的隔离只是一个环节,仍需保护 reset、交接产物、依赖/规则、评分入口与 release;分别记录任务结果和完整性结论。超时、证据缺失、未知事件不能 fail-open 成功;形式模型通过不等于真实 backend 的网络、挂载和原始 socket 均可观测。对内部 runner 的最小后续试验是答案暴露但未使用、评分路径被改、verifier 超时三类负例,尚未在本任务执行。^[raw/articles/benchshield-reward-lifecycle-integrity-2026-09-12.md]

失败结果也须有落盘余量:agent 执行预算、内部 evaluation budget、外层 verifier deadline 分开;串行子测试共享单调时钟的剩余预算,保留 headroom 写 reward、诊断并清理。不能把完整外层预算反复分给子进程,也不能用快速 oracle 随意缩短合法解窗口。超时零分须另存任务/环境/agent 的失败归因;内部 runner 后续用强制内层超时验收截止前有回执,不将缺 reward 或 infra 故障伪装成 agent 错误。^[raw/articles/harbor-index-curation-parity-and-version-snapshots-2026-09-13.md]

输出绑定与委托授权分验:输出签名验证交付字节;父引用或子方签名不能证明父方同意。若系统要求双边委托授权,应验父子对同一具体边的签署、信任目录、撤销/有效期及 nonce 状态;父方拒签应阻断。单个 verifier 的防重放断言不能外推为跨 verifier 保证。参见 A2A-Agent2Agent-Protocola2a-output-attestation-and-delegation-ancestry;这是接入审查准则,不是已部署双签服务。^[raw/articles/a2a-output-attestation-and-delegation-ancestry-2026-09-11.md]

贯穿上下文与协作:地址、标签、授权各负其责

  • 语义发现 → 精确回读Context-Engineering 中的概念摘要是有损视图,raw 是原始证据。已知路径后按原始对象回读,保留 URL/版本/hash 与定位信息;无效地址明确失败或给出未确认候选,不把近似命中当原对象。压缩率不能替代关键 ID/报错恢复率、回读成本和最终正确性。沿用现有云端向量检索,不直接替换 runtime。^[raw/articles/arc-addressable-recall-context-compaction-2026-09-11.md]
  • 来源信任不因摘要提升:外部 payload 经过格式化、结构化、入库或再次召回,仍是外部资料,不变成用户指令。规划 metadata 也不能夹带未经约束的外部指令;身份、目的地、支付/发布参数等高影响字段需独立授权。spa-plan-first-label-preserving-persistent-agents 的信息流控制属于可借鉴架构,当前 wiki 只落实来源/证据标注,不声称有字段级 IFC。^[raw/articles/spa-plan-first-label-preserving-persistent-agents-2026-09-11.md]
  • 允许读取不等于允许组合披露topbench-compositional-privacy-and-harness-integrity 将单源不可推断、跨源可推断与任务必要性分开;正常任务也可能产生不必要的敏感结论,不必存在注入。多源汇聚/摘要/发布按任务与接收方复核,分别衡量任务效用、最终回答和接口实际可见 reasoning 的泄漏;不假装可访问隐藏思维链,也不把 JSON 标签核查当隐私语义或生产安全实测。^[raw/articles/topbench-compositional-privacy-and-harness-integrity-2026-09-15.md]
  • 长程 context / computer-use loop:优先 structured state、semantic action、verified state path、observation channel、action receipt 与 attention/context ledger。Context-EngineeringLoop-EngineeringHarness-Engineering 分别负责可见信息、闭环与执行约束。
  • skill / workspace 污染防线:外部或 agent-authored skill 必须带来源 hash、run id、review 状态,保存 claim/status/broadcast/merge/verifier 协议;共享内容不是天然可信资产。归属 Agent-Skill-DiscoveryLoop-Engineering
  • 控制面谱系而非工具堆积:重复 gateway 候选先比较 backend_protocols、registry_scope、identity_model、credential_boundary、policy_surface、observability 与 federation risk;只有新增机制或反例才晋升。大规模 comparison/迁移留专门任务。

链接、索引与发布验收合同

  1. 正文互链:最近七天新增/更新的 AI 文章至少连接一个六轴主题簇,并有两个其他既有概念页链接;不能只靠发布时会被剥离的 frontmatter related。新增 source 应获主题概念反链;日报由本页的证据窗口承接,不能只在顶层索引中有入口。
  2. 局部与历史分账:核对真实路径/标题、frontmatter、正文写入时间、raw 来源与导航。先保留 broken-link 基线,再验收新增差集;历史断链不是“零异常”,但不要借它否定本次正确修改或无人批量猜链接。
  3. 路径集合,而非只看总数:文件系统正式文章、wiki-query、向量 metadata 与覆盖监控的 eligible 集合逐路径一致,raw/导航单列。监控扫描器本身也可能漏类型:09-15 补齐 comparisons/frameworks 修复的是已索引页面不受监控的盲点,并非补入丢失索引。并发写入/索引中状态要与最终完成快照区分;详见 log.mdllm-wiki-optimization-2026-09-09llm-wiki-optimization-2026-09-10
  4. 真实检索回归:内容更新后运行 ~/llm-wiki/bin/wiki-vquery-run index --reindex,核对 FAISS ntotal、metadata、category/type 分布,再实查修改页;分类/类型工具变更另验 stats、recent、filter 与增量保留。保持 GLM Embedding-3 云端后端。
  5. 发布与通知分别验收:执行 ~/llm-wiki/scripts/publish-wiki-to-cvm.py --since-hours 36 后,回读确切公网目标,核对正文与 manifest,不只看 HTTP 200;回执绑定目标/动作/时间,hash 只证明字节而非全部执行链无旁路。36h 是展示窗口,不是上传范围。入口统一为 https://abos-at.work/llm-wiki/index.html。生成、索引、CVM、投递分别记状态;检查 cron 的 last_errorlast_delivery_error 与实际输出,delivery_failed 不代表未入库,网页可读不证明消息送达。故障留独立维护,不重复摄入或绕过自动投递发送。
  6. 审计也须对账:用路径清单/原始回执核对文件、样本、数量与指标;raw 不改,更正留痕。检查器版本也属于实验条件:前后记录工具 hash/版本、配置和扫描范围;工具变更时重新建立同口径基线,不能把告警下降算成内容修复。lint 看实际问题统计而非包装器退出码,全库/正式页/新增差集分账,并保留独立路径/链接检查。审计实例见 llm-wiki-optimization-2026-09-14log.md 的早报回查记录。
  7. 停手边界:操作、链接差集、索引与公网回读实测结果写 log.md;没有新机制不再加“今日正常”章节。批量拆页、权限加固、cron/gateway 改造不由本任务顺带执行。

当前雷达判断与维护边界(2026-09-17)

已核active cron 83236dfdb31f与七日实际资料:启用、09:00调度,六轴/web-first/人物低权重明确;资料跨协议、实现、组织、论文、安全公告及RFC,未见单一人物/来源收敛。运行与通知状态只记log.md,不每天在稳定机制中复写故障流水账;不改gateway或代发。

MCP/A2A/安全交叉仍偏多;ARC/SPA补独立context,Hyper-tau进一步补需求恢复/多模态事实覆盖,但没有本机受控实验。后续按缺口补MCP跨IdP撤销/策略失联、原生视觉context与自适应攻击证据;STOA Draft、摘要候选及重复教程不凑配额晋升。Harbor已晋升,既有contested未自动关闭;状态以最新候选账本为准。

大范围维护仍需单独安排:既有断链/别名、超长 Harness/Benchmark/Context/MCP/A2A 概念页、顶层 source 长列表与缺失 SCHEMA;本轮只整理此总览和导航,缺链才做低风险修补,不批量拆页或建立新的 taxonomy。

最近七天的证据入口

历史证据导航(不作为当前日期窗口)

写入记录

  • 2026-09-03 21:00 CST:合并/升级自我优化日志为总览页,明确 CVM 入口、雷达轴、日志分层和 wikilink 串联规则。
  • 2026-09-03 12:01 CST:汇总近 7 天 llm-wiki-optimization-* 观察,新增权限/凭据边界、候选晋升 tape、benchmark/verifier 合同、MCP 控制面谱系、A2A 证据门槛、长程 context loop、skill 污染防线等机制级规则,并记录当日雷达轴与主题簇互链检查结论。
  • 2026-09-04 12:00 CST:执行 llm-wiki 自我优化汇总;确认 AegisFlow 触发的动作级 policy-gateway 规则已完成机制升级,AI 雷达仍按六个知识点轴运行,最近 36 小时新增/更新页未发现缺少主题簇 wikilink。
  • 2026-09-04 09:00 CST:根据 AegisFlow 入库,补充 policy-gateway 候选晋升标准与动作级证据链检查。
  • 2026-09-05 09:00 CST:补充 MCP/A2A trust receipt 作为雷达 gate 与 wiki 自我优化规则。
  • 2026-09-05 12:00 CST:执行 llm-wiki 自我优化汇总;确认 trust receipt gate 已完成机制升级,AI 雷达仍按六个知识点轴运行,最近 36 小时新增/更新页未发现缺少主题簇 wikilink。
  • 2026-09-06 09:00 CST:补充 execution planning receipt 作为雷达 gate 与 wiki 自我优化规则,要求后续 runtime/gateway 候选记录 task envelope 与 runtime placement。
  • 2026-09-06 12:00 CST:执行 llm-wiki 自我优化汇总;确认 execution planning receipt 已完成机制升级,AI 雷达仍按六个知识点轴运行,最近 36 小时新增/更新页未发现缺少主题簇 wikilink。
  • 2026-09-07 09:00 CST:补充 registry-to-runtime bridge 与 A2A task-state harness 作为雷达 gate 与 wiki 自我优化规则。
  • 2026-09-07 12:00 CST:执行 llm-wiki 自我优化汇总;确认 registry-to-runtime bridge 与 A2A task-state harness 已完成机制升级,AI 雷达仍按六个知识点轴运行,最近 36 小时新增/更新页未发现缺少主题簇 wikilink。
  • 2026-09-08 12:00 CST:执行 llm-wiki 自我优化汇总;确认 asset-control-plane receipt 与 marathon-eval receipt 已完成机制升级,AI 雷达仍按六个知识点轴运行,最近 36 小时新增/更新页未发现缺少主题簇 wikilink。
  • 2026-09-08 09:01 CST:补充 asset-control-plane 与 marathon-eval receipt 作为雷达 gate 与 wiki 自我优化规则。
  • 2026-09-08 09:03 CST:记录本轮 reindex、语义检索和 targeted link check receipt,并标注 broad link check 的历史噪音边界。
  • 2026-09-09 09:01 CST:补充 tool-route、action-interception、protocol-binding receipts 作为 llm-wiki 雷达 gate 与自我优化规则。
  • 2026-09-09 09:01 CST:记录并已修复 wiki-vquery 增量索引缩成 1-doc、类型推断 entitie/strategie、缺少 comparisons/frameworks category subdir 的问题。
  • 2026-09-10 12:03 CST:汇总 09-04 至 09-10 观察;将按日追加章节改为统一控制链与三条横切检查,增加正文互链/反链、三方路径集合和公网正文回读验收;保留历史证据导航与写入记录,明确机制规范不代表运行时已部署。
  • 2026-09-11 12:02 CST:汇总 09-05 至 09-11 观察;将全文完整性、作者回执/本机核查分层、指标语义、地址与信任标签、双边委托授权纳入既有机制,增加日志对账与真实 lint 验收;更新 context 覆盖判断,未新建日报或部署运行时控制。
  • 2026-09-12 12:03 CST:汇总 09-06 至 09-12 观察,将有效发现/分层授权、案例与规范分轨、借权前检查、奖励链路和弃权分母合入既有控制链;保留历史记录,关闭已补回原文的过期待办表述,不新建日报或改变运行时配置。
  • 2026-09-13 12:05 CST:汇总 09-07 至 09-13 观察,将有效配置、观察/执行恢复、题目有效性与版本快照、超时落盘余量合入既有机制;更新 Harbor 晋升状态,并将内容/索引/发布/消息投递分验纳入合同,保留历史记录,不新增日报或修改运行时。
  • 2026-09-14 12:06 CST:汇总 09-08 至 09-14 观察,将引导权限、adapter/host 责任、指标入口/判分可见证据和检查器版本合入既有机制;更新候选与投递状态,保留历史记录,不新增日报或改变运行时配置。
  • 2026-09-15 12:03 CST:汇总 09-09 至 09-15 观察,将对象/完整性绑定、逐跳发现认证、模型可见输入与组合披露合入既有控制链;覆盖监控自身也纳入路径集合验收,压缩重复说明并保留历史记录,不新增日报或修改运行时。
  • 2026-09-16 12:02 CST:汇总 09-10 至 09-16 观察,将回传状态/头体一致、后台分权、fixture 入口和未判分/全 run 成本纳入原控制链与三条检查;合并相邻机制段落,保留历史记录,不新增日报或修改运行时。
  • 2026-09-17 12:04 CST:汇总09-11至09-17观察,将独立需求覆盖、pilot反馈/宏平均预算、健康事件时间与错误/业务终态分验合入既有机制;运行状态移交log,保留历史记录,不新增日报或修改运行时。