← 返回藏书阁

llm-wiki 自我优化 2026-09-17:证据覆盖、反馈暴露与托管语义

wiki/ai/sources/llm-wiki-optimization-2026-09-17.md
分类:ai / sources · 更新:2026-09-17 09:11 最近更新

llm-wiki 自我优化 2026-09-17:证据覆盖、反馈暴露与托管语义

今天新增的判断

检索成功不证明需求覆盖;“隐藏”不自动覆盖全部计分样本;托管服务透明转发也不抹掉 HTTP、鉴权与健康状态语义。 今天按知识点挑选两组深度材料,不按人物或每日新工具配额扩张。

知识点轴深挖内容证据实际到哪一层
A2A / harness-runtime / sandbox-securityaws-agentcore-a2a-host-contract-and-health-semantics:Card、SDK分支、非2xx错误、ping生命周期官方正文、固定commit、隔离AST函数fixture;未运行云部署/鉴权/SSE
benchmark-evaluation / context management / harness-runtime;sandbox-security为隔离设计hyper-tau-bench-evidence-recovery-and-agent-construction:从业务记录恢复需求,评测交付agent的真实行为论文主文及附录文本、原HTML表格核查;未取得runner/数据/逐trial,未重跑模型

深度价值不在 headline:AWS 案例可转为 host 集成负例;Hyper-tau 可转为内部政策/工单 agent 的需求恢复与独立状态验收。它们分别补 A2A-Agent2Agent-ProtocolAgent-BenchmarksContext-Engineering,不另造平行概念。

对知识库的低风险改进

已将以下内容同步 AI-Knowledge-Point-Radar,复用 LLM-Wiki-Optimization-Log 的证据/对象配置/实际边界三条检查:

  1. 按主张记录证据缺口,不按搜索次数冒充覆盖。 搜索负责定位,主张仍需完整必要段落/版本/例外;未获得事实全集时不声称覆盖百分比。论文中“把自己猜的规则写入测试”提醒我们:wiki摘要与其自编测试不能互相充当独立证据。cron无人时保留未知,不编造用户决定。^[raw/articles/hyper-tau-bench-evidence-recovery-and-agent-construction-2026-09-17.md]
  2. 隐藏与允许反馈分账。 论文五个pilot任务允许一次反馈,样本仍计分;这是设计例外,不能写成所有样本全隐藏。raw quality、预算惩罚、task-macro与conversation-micro分别记录;银行35/53权重与oracle ceiling不能从标题省略。^[raw/articles/hyper-tau-bench-evidence-recovery-and-agent-construction-2026-09-17.md]
  3. host状态分层,不用同一个“成功/错误”概括。 记录HTTP与JSON-RPC、真实auth方向、session state、health callback异常、事件时间与采样时间;Healthy不证明callback成功,可重试provisioning conflict不覆盖写入后的不确定结果。^[raw/articles/aws-agentcore-a2a-host-contract-and-health-semantics-2026-09-17.md]

正文互链补到三个主题概念,保留历史来源;主概念只加短入口。Radar首页替换本日观察,不堆叠新receipt名称。原有raw不修改,不改cron/gateway/权限、检索模型、工具源码或其他profile。

本轮核查与边界

16项离线检查全部完成,范围为已读SDK函数AST+文档JSON/AST+论文表格/公式:ping异常回退Healthy、端口优先级、Card服务/协议版本、教程非streaming、53个ID/3,365会话槽位、pilot列表与task-macro均值。这是证据核查,不是16个云端或benchmark测试。输入、脚本和结果保存在 raw/assets/ai-radar-20260917/。^[raw/notes/ai-radar-evidence-checks-2026-09-17.md]

最初web_extract对论文/选型页返回大量省略段,已用原站HTTPS取回主要入库文本;GitHub API限流通过git ref与固定raw补取源码,仍不报star。抽取器的成功状态不能替代全文完整性检查。

未晋升及原因

  • MCP Gateway / harness-runtime / sandbox-security:federation buyer guide已读主文章,仅raw;“next-call撤销”等是厂商声明,缺固定实现和跨IdP/策略失联/撤销回执。最高优先不等于必须建页。
  • sandbox-security / benchmark-evaluation:Adaptive out-of-band defenses只读完整摘要;全文抽取是省略片段,未核自适应攻击实现与数据,不晋升。
  • harness-runtime / benchmark-evaluation:Agentic SDLC成本综述仅摘要,无新实验且与已有主题重叠,raw-only,不追逐新术语。
  • A2A / harness-runtime:Researcher→Writer教程仅搜索级,重复基础范式;benchmark-evaluation / context management 的OSWorld/WeaveBench已有页,无足够新证据,不重复入库。

七组候选的六维评分与访问范围见 raw/notes/ai-knowledge-radar-2026-09-17.md。正式晋升两组,另建本篇优化文章;不是七篇新知识。

下一步建议

  1. 内部runner:增加提交后504、202异步、分页三类隔离负例,同时核独立业务终态,别只看接口返回。
  2. A2A接入:在测试环境分别验409两种原因、ping callback故障与9000端口契约,再做真实Card/认证/断流测试。
  3. 雷达轮换:加入 requirements coverage / 需求覆盖pilot exposure / 试运行样本暴露task-macro score / 任务宏平均分health callback fallback / 健康回调降级;MCP继续优先找跨IdP撤销与失联证据,安全候选优先补adaptive攻击全文/artifact。

旧断链/缺SCHEMA/长页和日报检索拥挤仍为专项维护;本轮不批量拆页。索引、lint与公网发布实测在 log.md 留回执,执行前不预写成功。统一用户入口:https://abos-at.work/llm-wiki/index.html。通知由cron自动投递,不另发消息或声称已收到。

写入记录

  • 2026-09-17 09:08 CST:新增两组深度判断、未晋升原因与知识库低风险gate;明确离线核查和部署/评测未验证范围。