Adversarial Attacks on LLMs
摘要
Lilian Weng 系统梳理 LLM 安全攻击面。包括越狱攻击(Jailbreak)、提示注入(Prompt Injection)、数据投毒、后门攻击。防御策略涉及红队测试、安全对齐、输入过滤、输出检测。多模态模型面临更大攻击面。
相关概念
- Jailbreak
- Prompt Injection
- Red Teaming
- Adversarial Attack
Lilian Weng 系统梳理 LLM 安全攻击面。包括越狱攻击(Jailbreak)、提示注入(Prompt Injection)、数据投毒、后门攻击。防御策略涉及红队测试、安全对齐、输入过滤、输出检测。多模态模型面临更大攻击面。