Agent Skill Security:技能生命周期威胁模型
Agent Skill Security:技能生命周期威胁模型
为什么重要
用户的 wiki 已经长期跟踪 Agent-Skill-Discovery 和 External-Agent-Skills-Design-Patterns。这篇论文的价值在于把“读 README 后判断 skill 质量”升级为“评估 skill 生命周期的安全边界”。第三方 skill 不只是 prompt 文档,而是会被检索、选择、执行、演化的供应链组件。
机制 / 一阶原理
SkillSec-Eval 把 skill 生态拆成多个信任边界:
- Repository admission:技能进入仓库前是否被审查。
- Semantic retrieval:检索是否会被恶意描述、同名/近名诱导或 embedding 攻击操纵。
- Planner selection:planner 是否会选择不该用的 skill,或忽略权限/上下文边界。
- Runtime execution:skill 的脚本、工具、网络、文件和秘密访问是否安全。
- Skill evolution:自动改写/自学习 skill 是否会把恶意或低质量模式持久化。
其一阶原理是:skill 风险不是“执行时才出现”,而是在发现、入库、检索、路由、执行和演化每一层都可能积累。
与既有 wiki 的关系
- 补强 Agent-Skill-Discovery:发现阶段不能只按 star、install count 或官方来源排序。
- 补强 External-Agent-Skills-Design-Patterns:设计模式需要配套 security lifecycle,而不是只迁移触发词、fallback 和验证步骤。
| - 呼应 [[agent-skill-malware | Cloak and Detonate]]、[[agent-skill-supply-chains | Skills Are Not Islands]]:skill 安全需要行为测试、依赖 manifest 和 lockfile-like 记录。 |
对 Hermes / llm-wiki 的可执行启发
- 外部 skill 页面应区分“可学习模式”和“可安装执行包”;默认只学习模式,不自动安装。
- 新 skill 的 manifest 应至少记录:来源 URL/commit、依赖、脚本、权限、外部服务、触发条件、负面边界、验证方式。
- 技能发现 radar 应新增一个安全评分维度:admission / retrieval / planner / runtime / evolution 是否都有明确防线。
失败模式与边界
论文是框架型贡献,不能替代对具体 skill 的人工审查和 sandbox detonation。过度依赖 LLM 静态审查会漏掉 packed payload、动态依赖和环境变量外传;过度依赖 registry 信誉又会忽略 retrieval/planner 层攻击。
写入记录
- 2026-07-18 09:00 CST:新增来源页,归纳机制、与既有概念的关系、Hermes/llm-wiki 启发和边界条件。