Universal Adversarial Triggers for Attacking and Analyzing NLP¶
Authors: Wallace et al. Year: 2019 ArXiv/Link: https://arxiv.org/abs/1908.07125
Summary¶
Universal adversarial triggers - short token sequences that cause misclassification regardless of input.
Key Concepts¶
- Adversarial triggers
- Universal attacks
- Transferable attacks
- NLP vulnerabilities
- Model robustness
Impact¶
Revealed fundamental vulnerability in NLP models
Category¶
Jailbreaks & Attacks