Cloak and Detonate — Agent Skill Malware
Cloak and Detonate — Agent Skill Malware
这篇 arXiv 论文关注第三方 agent skills 的供应链攻击面。论文摘要称,恶意 skill 可以以 agent 权限窃取凭证、外传源码或植入后门;静态 skill scanner 面对 payload-preserving evasion 很脆弱。作者提出 SkillCloak(结构混淆与 self-extracting skill packing)绕过静态/LLM-as-judge scanner,并提出 SkillDetonate:在沙箱中执行 skill,通过 OS 边界的信息流证据检测恶意行为。
为什么对用户重要
用户的知识库已经持续关注外部 skills、Hermes skill 设计和 agent workflow 复用。随着 skills 越来越像“可安装软件包”,风险也从 prompt 质量扩展到 supply-chain security。这个来源值得深挖,因为它把 External-Agent-Skills-Design-Patterns 的“质量评估”升级为“行为级安全评估”。
对 Hermes 尤其关键:skill 一旦被加载,可能影响工具使用、文件读写、网络访问、凭证处理和最终回复。只检查 README/frontmatter/prompt 是否看起来正常是不够的。
机制 / 一阶原理
摘要中的关键机制:
- SkillCloak:保持恶意语义、改变可见形态。结构混淆把 payload indicator 改写成等价形式;Self-Extracting Skill packing 在安装期隐藏恶意组件,执行期再恢复。
- 静态 scanner 的根本弱点:pattern matching 或 LLM-as-judge 看的是安装期文本外观,而攻击者可以改变外观不改变行为。
- SkillDetonate:行为中心的 runtime auditor。在沙箱中执行 skill,观察 agent context、文件、进程、网络操作之间的敏感数据流。
- 检测目标从“看起来恶意”改为“产生了恶意效果”。论文摘要报告 SkillDetonate 检测 97% 攻击、2% false positive,并在真实恶意 skills 上保持 87% 检测。
一阶原理是:当 artifact 可执行、可联网、可读写敏感信息时,安全评估必须从静态文本审查转向动态行为证据。
与已有 wiki 概念的关系
- 与 External-Agent-Skills-Design-Patterns:补充“安装/适配外部 skill 前必须做行为级安全门禁”。
- 与 Agent-Skill-Discovery:skill 发现不能只看 star、安装量和 README;需要来源可信度、权限范围和 sandbox eval。
- 与 Harness-Engineering:skill 运行需要 containment harness,限制 blast radius。
- 与 anthropic-agent-containment:产品级 containment 原则同样适用于 skill 生态。
对 Hermes / llm-wiki 的可执行启发
- 外部 skill 入库可以继续,但不要自动安装;先以 source/concept 页面沉淀设计模式与风险。
- 如果未来要安装第三方 skill,应建立最小 sandbox checklist:文件访问、网络访问、环境变量/凭证读取、shell 执行、持久化写入。
SKILL.mdlint 不应只查 frontmatter 和触发语,还应标注权限边界、可执行脚本、外部下载、post-install 行为。- 雷达关注名单应新增“agent skill security / skill malware / sandboxed skill eval”方向。
失败模式 / 边界
- 当前只摄入 arXiv API 摘要,未验证全文实验设置、scanner 列表和数据集构造。
- 动态 detonating skill 也可能被环境检测绕过;sandbox fidelity 是关键难点。
- 行为检测可能成本高,不适合每个低风险 prompt-only skill;需要按权限和可执行性分级。
写入记录
- 2026-07-05 09:02 CST:新增 source 页面,提炼 agent skill malware 对 Hermes skill 发现、安装前 sandbox 和 llm-wiki 雷达关注名单的启发。