llm-wiki 自我优化 2026-09-13:示例配置要实查,低分题目要先验真
llm-wiki 自我优化 2026-09-13
今天留下两条可复用判断:SDK 安全默认值不能覆盖 demo/fixture 的实际 override;agent 低分不能覆盖坏题与评分器缺陷。 不新增一套 receipt 命名体系,继续使用 LLM-Wiki-Optimization-Log 的证据、配置、真实状态三条检查。
发现与实际入库
A2A / harness-runtime / sandbox-security
a2a-jakarta-cross-node-state-and-effective-security:09-10 发布的 Jakarta 案例用 JPA 保存 task/push 配置、Kafka 复制实时事件,让 B 订阅在 A 执行的任务。本轮固定 tag 并核对源码,发现企业 demo 实际关闭 task authorization;多租户 JSON-RPC fixture 还跳过 transport validation。订阅使用固定 sleep、cancel 明确拒绝,说明可观察≠可恢复执行≠生产安全。^[raw/articles/a2a-jakarta-cross-node-state-and-effective-security-2026-09-13.md]
深度判断:从公告深入到 POM/config/client/executor,得到可以迁移到 Hermes 接入验收的具体负例,故晋升;不是单 SDK 新闻。12 项本机静态断言通过,不是 Java/TCK/E2E 已通过。README/POM 的 SDK 版本差异已显式保留。
benchmark-evaluation / harness-runtime / sandbox-security
harbor-index-parity-task-validity-and-snapshot-boundaries:补读昨日 Harbor raw 的 parity、审题、泄漏与误判修复。原实现与 adapter 要匹配模型/工具/预算;oracle 满分也不能证明判分无漏洞。最新仓库文档另给出内部评价预算与外层 verifier 截止时间分层,让超时仍来得及写 reward/诊断。^[raw/articles/harbor-adapters-harbor-index-2026-09-12.md] ^[raw/articles/harbor-index-curation-parity-and-version-snapshots-2026-09-13.md]
深度判断:直接改进 BASE/RED/GOLD runner 的题目有效性与失败归因,足够晋升。但论文/博客的 28.0%/25.6%、1,476/1,414,当前 README 的 80 题与论文的 82 题尚非同一可对账快照;保留 contested,只吸收机制,不混造排行榜。
候选评分与未晋升原因
每维 1–5,顺序为 relevance / novelty / durability / actionability / source-quality / depth-potential;分数辅助分流,不自动晋升。
| 候选 | 命中知识点轴 | 六维 / 总分 | 本轮处理 |
| A2A Jakarta enterprise | A2A、harness-runtime、sandbox-security | 5/5/5/5/5/5 = 30 | 深入固定 tag,晋升 |
| Harbor Adapters / Index | benchmark-evaluation、harness-runtime、sandbox-security | 5/5/5/5/4/5 = 29 | 补读昨日 raw,晋升 |
| TrueFoundry federation | MCP Gateway、harness-runtime、sandbox-security | 5/3/5/4/4/4 = 25 | 官网全文 raw-only;缺版本化实现与策略失联/撤销负例,已有机制重叠 |
| MCPG federation | MCP Gateway、sandbox-security | 5/2/4/4/3/4 = 22 | 今日搜索再次命中,沿用昨日 raw-only,不重复建页 |
| VERA multimodal history | context management、harness-runtime、benchmark-evaluation | 4/4/4/3/4/4 = 23 | 只读摘要,raw-only;视觉 token/预算/配对条件未核 |
| Boundary-Bench | sandbox-security、benchmark-evaluation | 5/1/5/4/5/5 = 25 | 已有正式页,重复跳过 |
| KVMem | context management、harness-runtime | 3/4/4/2/4/4 = 21 | search-only;本地 KV/GPU 实现对云 API 用户当下可执行性较低 |
没有把未晋升等同「没价值」:TrueFoundry 的 proxy_url/逐跳授权/NATS/trace、VERA 的原生视觉证据是下一轮候选。前者的示例审计 JSON 不是实跑回执,后者的摘要数字不是已核结论。搜索误命中的 Visa account-to-account 不属于 Agent2Agent 轴,不计为技术候选。
已实施的低风险优化
- AI-Knowledge-Point-Radar 新增 effective configuration / 有效配置 检查:区分 SDK default、demo override、test fixture、真实部署;每个 skip 标明到底免除了什么验证。
- 将「坏题先验真」纳入既有 benchmark gate:oracle、parity、合法替代实现、伪解、超时后回执分别验;不把 SEM 近似相符写成严格统计等价。
- 候选生命周期继续写新证据:昨日 immutable raw 的 raw-only 判断保留,今日晋升在 source/新账本/log 记录,不倒改旧 raw。同步 A2A-Agent2Agent-Protocol、Agent-Benchmarks 的短入口/反链。
- 双语轮换词:
cross-node task resubscription / 跨节点任务重订阅、effective security configuration / 有效安全配置、adapter parity / 适配器语义对齐、verifier timeout headroom / 判分器超时余量。VERA 暂作modality-preserving context / 模态保留上下文的低权重来源 seed。
从用户角度看,还应怎么调整
Context-Engineering 不缺更多摘要,缺的是保留原始视觉/状态证据的受控比较;下次优先补读 VERA 的预算和配对实验,而非再堆 memory 工具。A2A 继续最高优先,但从可读 Card 往跨实例状态、授权 fixture 和恢复负例推进。MCP 联邦下一步看 stale policy/撤销/循环与逐跳 auth,不再只计支持几个协议。
长期维护债务仍包括历史断链、缺 SCHEMA、超长概念页和日报挤占语义检索。本轮只做短增量互链与 gate;拆分大页、改变检索排序、cron/gateway/权限配置不顺带执行。
本轮文件清单
新建 wiki/ai/sources/:
a2a-jakarta-cross-node-state-and-effective-security.mdharbor-index-parity-task-validity-and-snapshot-boundaries.mdllm-wiki-optimization-2026-09-13.md(本页)
更新 wiki/ai/concepts/:A2A-Agent2Agent-Protocol.md、Agent-Benchmarks.md、AI-Knowledge-Point-Radar.md;更新 _index.md 和 log.md。
新增原始资料:
raw/articles/a2a-jakarta-cross-node-state-and-effective-security-2026-09-13.mdraw/articles/harbor-index-curation-parity-and-version-snapshots-2026-09-13.mdraw/articles/truefoundry-federated-mcp-gateway-raw-only-2026-09-13.mdraw/articles/vera-modality-preserving-context-abstract-raw-only-2026-09-13.mdraw/notes/ai-knowledge-radar-2026-09-13.md
复用且未修改 raw/articles/harbor-adapters-harbor-index-2026-09-12.md。语义索引派生文件为 ../.vector_index/wiki.faiss、../.vector_index/meta.json;现有 publisher 生成 HTML/manifest。准确运行回执以 log.md 和 /tmp/ai-radar-20260913/ 为准。
证据边界
Firecrawl 抽取/部分搜索失败后,通过原站 HTTPS 与固定 tag clone 补回主要材料。GitHub API 限流,未取得可靠 star;Harbor job-config.yaml 超时未用作证据。没有运行外部代码、启动容器、登录业务系统、上传轨迹或执行安全 PoC;SDK/论文机制不等于已经部署到 Hermes。
写入记录
- 2026-09-13 09:14 CST:新增当日自我优化文章,记录两篇深度 source、七候选评分、有效配置与坏题检查、raw 生命周期及未验证范围;保持六轴/web-first,不做人物追踪。