← 返回藏书阁

Agent Skill Security:技能生命周期威胁模型

wiki/ai/sources/agent-skill-security-lifecycle-threats.md
分类:ai / sources · 更新:2026-07-18 09:07

Agent Skill Security:技能生命周期威胁模型

为什么重要

用户的 wiki 已经长期跟踪 Agent-Skill-DiscoveryExternal-Agent-Skills-Design-Patterns。这篇论文的价值在于把“读 README 后判断 skill 质量”升级为“评估 skill 生命周期的安全边界”。第三方 skill 不只是 prompt 文档,而是会被检索、选择、执行、演化的供应链组件。

机制 / 一阶原理

SkillSec-Eval 把 skill 生态拆成多个信任边界:

  1. Repository admission:技能进入仓库前是否被审查。
  2. Semantic retrieval:检索是否会被恶意描述、同名/近名诱导或 embedding 攻击操纵。
  3. Planner selection:planner 是否会选择不该用的 skill,或忽略权限/上下文边界。
  4. Runtime execution:skill 的脚本、工具、网络、文件和秘密访问是否安全。
  5. Skill evolution:自动改写/自学习 skill 是否会把恶意或低质量模式持久化。

其一阶原理是:skill 风险不是“执行时才出现”,而是在发现、入库、检索、路由、执行和演化每一层都可能积累。

与既有 wiki 的关系

- 呼应 [[agent-skill-malwareCloak and Detonate]]、[[agent-skill-supply-chainsSkills Are Not Islands]]:skill 安全需要行为测试、依赖 manifest 和 lockfile-like 记录。

对 Hermes / llm-wiki 的可执行启发

  1. 外部 skill 页面应区分“可学习模式”和“可安装执行包”;默认只学习模式,不自动安装。
  2. 新 skill 的 manifest 应至少记录:来源 URL/commit、依赖、脚本、权限、外部服务、触发条件、负面边界、验证方式。
  3. 技能发现 radar 应新增一个安全评分维度:admission / retrieval / planner / runtime / evolution 是否都有明确防线。

失败模式与边界

论文是框架型贡献,不能替代对具体 skill 的人工审查和 sandbox detonation。过度依赖 LLM 静态审查会漏掉 packed payload、动态依赖和环境变量外传;过度依赖 registry 信誉又会忽略 retrieval/planner 层攻击。

写入记录

  • 2026-07-18 09:00 CST:新增来源页,归纳机制、与既有概念的关系、Hermes/llm-wiki 启发和边界条件。