← 返回藏书阁

llm-wiki 自我优化 2026-09-13:示例配置要实查,低分题目要先验真

wiki/ai/sources/llm-wiki-optimization-2026-09-13.md
分类:ai / sources · 更新:2026-09-13 09:16

llm-wiki 自我优化 2026-09-13

今天留下两条可复用判断:SDK 安全默认值不能覆盖 demo/fixture 的实际 override;agent 低分不能覆盖坏题与评分器缺陷。 不新增一套 receipt 命名体系,继续使用 LLM-Wiki-Optimization-Log 的证据、配置、真实状态三条检查。

发现与实际入库

A2A / harness-runtime / sandbox-security

a2a-jakarta-cross-node-state-and-effective-security:09-10 发布的 Jakarta 案例用 JPA 保存 task/push 配置、Kafka 复制实时事件,让 B 订阅在 A 执行的任务。本轮固定 tag 并核对源码,发现企业 demo 实际关闭 task authorization;多租户 JSON-RPC fixture 还跳过 transport validation。订阅使用固定 sleep、cancel 明确拒绝,说明可观察≠可恢复执行≠生产安全。^[raw/articles/a2a-jakarta-cross-node-state-and-effective-security-2026-09-13.md]

深度判断:从公告深入到 POM/config/client/executor,得到可以迁移到 Hermes 接入验收的具体负例,故晋升;不是单 SDK 新闻。12 项本机静态断言通过,不是 Java/TCK/E2E 已通过。README/POM 的 SDK 版本差异已显式保留。

benchmark-evaluation / harness-runtime / sandbox-security

harbor-index-parity-task-validity-and-snapshot-boundaries:补读昨日 Harbor raw 的 parity、审题、泄漏与误判修复。原实现与 adapter 要匹配模型/工具/预算;oracle 满分也不能证明判分无漏洞。最新仓库文档另给出内部评价预算与外层 verifier 截止时间分层,让超时仍来得及写 reward/诊断。^[raw/articles/harbor-adapters-harbor-index-2026-09-12.md] ^[raw/articles/harbor-index-curation-parity-and-version-snapshots-2026-09-13.md]

深度判断:直接改进 BASE/RED/GOLD runner 的题目有效性与失败归因,足够晋升。但论文/博客的 28.0%/25.6%、1,476/1,414,当前 README 的 80 题与论文的 82 题尚非同一可对账快照;保留 contested,只吸收机制,不混造排行榜。

候选评分与未晋升原因

每维 1–5,顺序为 relevance / novelty / durability / actionability / source-quality / depth-potential;分数辅助分流,不自动晋升。

候选命中知识点轴六维 / 总分本轮处理
A2A Jakarta enterpriseA2A、harness-runtime、sandbox-security5/5/5/5/5/5 = 30深入固定 tag,晋升
Harbor Adapters / Indexbenchmark-evaluation、harness-runtime、sandbox-security5/5/5/5/4/5 = 29补读昨日 raw,晋升
TrueFoundry federationMCP Gateway、harness-runtime、sandbox-security5/3/5/4/4/4 = 25官网全文 raw-only;缺版本化实现与策略失联/撤销负例,已有机制重叠
MCPG federationMCP Gateway、sandbox-security5/2/4/4/3/4 = 22今日搜索再次命中,沿用昨日 raw-only,不重复建页
VERA multimodal historycontext management、harness-runtime、benchmark-evaluation4/4/4/3/4/4 = 23只读摘要,raw-only;视觉 token/预算/配对条件未核
Boundary-Benchsandbox-security、benchmark-evaluation5/1/5/4/5/5 = 25已有正式页,重复跳过
KVMemcontext management、harness-runtime3/4/4/2/4/4 = 21search-only;本地 KV/GPU 实现对云 API 用户当下可执行性较低

没有把未晋升等同「没价值」:TrueFoundry 的 proxy_url/逐跳授权/NATS/trace、VERA 的原生视觉证据是下一轮候选。前者的示例审计 JSON 不是实跑回执,后者的摘要数字不是已核结论。搜索误命中的 Visa account-to-account 不属于 Agent2Agent 轴,不计为技术候选。

已实施的低风险优化

  • AI-Knowledge-Point-Radar 新增 effective configuration / 有效配置 检查:区分 SDK default、demo override、test fixture、真实部署;每个 skip 标明到底免除了什么验证。
  • 将「坏题先验真」纳入既有 benchmark gate:oracle、parity、合法替代实现、伪解、超时后回执分别验;不把 SEM 近似相符写成严格统计等价。
  • 候选生命周期继续写新证据:昨日 immutable raw 的 raw-only 判断保留,今日晋升在 source/新账本/log 记录,不倒改旧 raw。同步 A2A-Agent2Agent-ProtocolAgent-Benchmarks 的短入口/反链。
  • 双语轮换词:cross-node task resubscription / 跨节点任务重订阅effective security configuration / 有效安全配置adapter parity / 适配器语义对齐verifier timeout headroom / 判分器超时余量。VERA 暂作 modality-preserving context / 模态保留上下文 的低权重来源 seed。

从用户角度看,还应怎么调整

Context-Engineering 不缺更多摘要,缺的是保留原始视觉/状态证据的受控比较;下次优先补读 VERA 的预算和配对实验,而非再堆 memory 工具。A2A 继续最高优先,但从可读 Card 往跨实例状态、授权 fixture 和恢复负例推进。MCP 联邦下一步看 stale policy/撤销/循环与逐跳 auth,不再只计支持几个协议。

长期维护债务仍包括历史断链、缺 SCHEMA、超长概念页和日报挤占语义检索。本轮只做短增量互链与 gate;拆分大页、改变检索排序、cron/gateway/权限配置不顺带执行。

本轮文件清单

新建 wiki/ai/sources/

  • a2a-jakarta-cross-node-state-and-effective-security.md
  • harbor-index-parity-task-validity-and-snapshot-boundaries.md
  • llm-wiki-optimization-2026-09-13.md(本页)

更新 wiki/ai/concepts/A2A-Agent2Agent-Protocol.mdAgent-Benchmarks.mdAI-Knowledge-Point-Radar.md;更新 _index.mdlog.md

新增原始资料:

  • raw/articles/a2a-jakarta-cross-node-state-and-effective-security-2026-09-13.md
  • raw/articles/harbor-index-curation-parity-and-version-snapshots-2026-09-13.md
  • raw/articles/truefoundry-federated-mcp-gateway-raw-only-2026-09-13.md
  • raw/articles/vera-modality-preserving-context-abstract-raw-only-2026-09-13.md
  • raw/notes/ai-knowledge-radar-2026-09-13.md

复用且未修改 raw/articles/harbor-adapters-harbor-index-2026-09-12.md。语义索引派生文件为 ../.vector_index/wiki.faiss../.vector_index/meta.json;现有 publisher 生成 HTML/manifest。准确运行回执以 log.md/tmp/ai-radar-20260913/ 为准。

证据边界

Firecrawl 抽取/部分搜索失败后,通过原站 HTTPS 与固定 tag clone 补回主要材料。GitHub API 限流,未取得可靠 star;Harbor job-config.yaml 超时未用作证据。没有运行外部代码、启动容器、登录业务系统、上传轨迹或执行安全 PoC;SDK/论文机制不等于已经部署到 Hermes。

写入记录

  • 2026-09-13 09:14 CST:新增当日自我优化文章,记录两篇深度 source、七候选评分、有效配置与坏题检查、raw 生命周期及未验证范围;保持六轴/web-first,不做人物追踪。