AI Agents Do Not Fail Alone:上下文先失败
AI Agents Do Not Fail Alone:上下文先失败
为什么重要
Context-Engineering 是用户 wiki 的核心概念,但过去很多页面强调“上下文质量重要”,缺少可操作评分维度。这篇论文把 context quality 作为独立 leading indicator 来测量,而不是等 agent 行为失败后再归因。
机制 / 一阶原理
论文把 agent 的 context 看作运行环境:instructions、tools、memory、retrieval、guardrails、untrusted inputs 共同塑造行为。弱 context 会导致 drift、hallucination、tool misuse、constraint ignoring、injection vulnerability 和 token waste。
它提出七个 context-quality criteria:
- role clarity
- guardrail coverage
- instruction consistency
- tool schema quality
- grounding sufficiency
- injection hardening
- token efficiency
关键设计是 非循环验证:context score 不直接进入 behavioral metric 或 release decision,因此可以观察 context quality 是否预测行为变化,而不是用结果反推原因。
与既有 wiki 的关系
- 延续 Context-Engineering 的“上下文是乘法杠杆”,但给出更可测的 rubric。
- 连接 Harness-Engineering:harness 应在执行前评分 context,而不是只在执行后评分产物。
| - 连接 AGENTS.md-Context-Files 与 [[aigx-context-format | AIGX]]:仓库上下文文件/结构不应只看是否存在,还要看七项质量。 |
对 Hermes / llm-wiki 的可执行启发
- 每个重要 skill / cron prompt 可增加 context-quality checklist,尤其检查 instruction consistency、tool schema quality 和 grounding sufficiency。
- llm-wiki 页面质量也可套用此 rubric:页面是否有清晰角色/适用场景,是否有足够来源,是否控制 token/篇幅,是否说明边界。
- 对无人 radar,候选源晋升前应问:它是否改善了 context quality 的某一维,还是只增加材料数量?
失败模式与边界
Context score 可能被 rubric 本身的偏差影响;多评审 LLM 也可能共享盲点。高 context score 不保证任务成功,只说明运行环境更可能支撑可靠行为。对 Hermes 来说,它应作为 preflight 指标,而不是替代真实验证。
写入记录
- 2026-07-18 09:00 CST:新增来源页,归纳机制、与既有概念的关系、Hermes/llm-wiki 启发和边界条件。