← 返回藏书阁

AI Agents Do Not Fail Alone:上下文先失败

wiki/ai/sources/context-fails-first.md
分类:ai / sources · 更新:2026-07-18 09:07

AI Agents Do Not Fail Alone:上下文先失败

为什么重要

Context-Engineering 是用户 wiki 的核心概念,但过去很多页面强调“上下文质量重要”,缺少可操作评分维度。这篇论文把 context quality 作为独立 leading indicator 来测量,而不是等 agent 行为失败后再归因。

机制 / 一阶原理

论文把 agent 的 context 看作运行环境:instructions、tools、memory、retrieval、guardrails、untrusted inputs 共同塑造行为。弱 context 会导致 drift、hallucination、tool misuse、constraint ignoring、injection vulnerability 和 token waste。

它提出七个 context-quality criteria:

  1. role clarity
  2. guardrail coverage
  3. instruction consistency
  4. tool schema quality
  5. grounding sufficiency
  6. injection hardening
  7. token efficiency

关键设计是 非循环验证:context score 不直接进入 behavioral metric 或 release decision,因此可以观察 context quality 是否预测行为变化,而不是用结果反推原因。

与既有 wiki 的关系

  • 延续 Context-Engineering 的“上下文是乘法杠杆”,但给出更可测的 rubric。
  • 连接 Harness-Engineering:harness 应在执行前评分 context,而不是只在执行后评分产物。
- 连接 AGENTS.md-Context-Files 与 [[aigx-context-formatAIGX]]:仓库上下文文件/结构不应只看是否存在,还要看七项质量。

对 Hermes / llm-wiki 的可执行启发

  1. 每个重要 skill / cron prompt 可增加 context-quality checklist,尤其检查 instruction consistency、tool schema quality 和 grounding sufficiency。
  2. llm-wiki 页面质量也可套用此 rubric:页面是否有清晰角色/适用场景,是否有足够来源,是否控制 token/篇幅,是否说明边界。
  3. 对无人 radar,候选源晋升前应问:它是否改善了 context quality 的某一维,还是只增加材料数量?

失败模式与边界

Context score 可能被 rubric 本身的偏差影响;多评审 LLM 也可能共享盲点。高 context score 不保证任务成功,只说明运行环境更可能支撑可靠行为。对 Hermes 来说,它应作为 preflight 指标,而不是替代真实验证。

写入记录

  • 2026-07-18 09:00 CST:新增来源页,归纳机制、与既有概念的关系、Hermes/llm-wiki 启发和边界条件。