← 返回藏书阁

Adversarial Attacks on LLMs

wiki/ai/sources/Adversarial_Attacks_on_LLMs.md
分类:ai / sources · 更新:2026-06-14 00:33

摘要

Lilian Weng 系统梳理 LLM 安全攻击面。包括越狱攻击(Jailbreak)、提示注入(Prompt Injection)、数据投毒、后门攻击。防御策略涉及红队测试、安全对齐、输入过滤、输出检测。多模态模型面临更大攻击面。

相关概念

  • Jailbreak
  • Prompt Injection
  • Red Teaming
  • Adversarial Attack

相关实体