← 返回藏书阁

Cloak and Detonate — Agent Skill Malware

wiki/ai/sources/agent-skill-malware.md
分类:ai / sources · 更新:2026-07-05 09:08

Cloak and Detonate — Agent Skill Malware

这篇 arXiv 论文关注第三方 agent skills 的供应链攻击面。论文摘要称,恶意 skill 可以以 agent 权限窃取凭证、外传源码或植入后门;静态 skill scanner 面对 payload-preserving evasion 很脆弱。作者提出 SkillCloak(结构混淆与 self-extracting skill packing)绕过静态/LLM-as-judge scanner,并提出 SkillDetonate:在沙箱中执行 skill,通过 OS 边界的信息流证据检测恶意行为。

为什么对用户重要

用户的知识库已经持续关注外部 skills、Hermes skill 设计和 agent workflow 复用。随着 skills 越来越像“可安装软件包”,风险也从 prompt 质量扩展到 supply-chain security。这个来源值得深挖,因为它把 External-Agent-Skills-Design-Patterns 的“质量评估”升级为“行为级安全评估”。

对 Hermes 尤其关键:skill 一旦被加载,可能影响工具使用、文件读写、网络访问、凭证处理和最终回复。只检查 README/frontmatter/prompt 是否看起来正常是不够的。

机制 / 一阶原理

摘要中的关键机制:

  1. SkillCloak:保持恶意语义、改变可见形态。结构混淆把 payload indicator 改写成等价形式;Self-Extracting Skill packing 在安装期隐藏恶意组件,执行期再恢复。
  2. 静态 scanner 的根本弱点:pattern matching 或 LLM-as-judge 看的是安装期文本外观,而攻击者可以改变外观不改变行为。
  3. SkillDetonate:行为中心的 runtime auditor。在沙箱中执行 skill,观察 agent context、文件、进程、网络操作之间的敏感数据流。
  4. 检测目标从“看起来恶意”改为“产生了恶意效果”。论文摘要报告 SkillDetonate 检测 97% 攻击、2% false positive,并在真实恶意 skills 上保持 87% 检测。

一阶原理是:当 artifact 可执行、可联网、可读写敏感信息时,安全评估必须从静态文本审查转向动态行为证据。

与已有 wiki 概念的关系

对 Hermes / llm-wiki 的可执行启发

  1. 外部 skill 入库可以继续,但不要自动安装;先以 source/concept 页面沉淀设计模式与风险。
  2. 如果未来要安装第三方 skill,应建立最小 sandbox checklist:文件访问、网络访问、环境变量/凭证读取、shell 执行、持久化写入。
  3. SKILL.md lint 不应只查 frontmatter 和触发语,还应标注权限边界、可执行脚本、外部下载、post-install 行为。
  4. 雷达关注名单应新增“agent skill security / skill malware / sandboxed skill eval”方向。

失败模式 / 边界

  • 当前只摄入 arXiv API 摘要,未验证全文实验设置、scanner 列表和数据集构造。
  • 动态 detonating skill 也可能被环境检测绕过;sandbox fidelity 是关键难点。
  • 行为检测可能成本高,不适合每个低风险 prompt-only skill;需要按权限和可执行性分级。

写入记录

  • 2026-07-05 09:02 CST:新增 source 页面,提炼 agent skill malware 对 Hermes skill 发现、安装前 sandbox 和 llm-wiki 雷达关注名单的启发。