Skip to content

Universal Adversarial Triggers for Attacking and Analyzing NLP

Authors: Wallace et al. Year: 2019 ArXiv/Link: https://arxiv.org/abs/1908.07125

Summary

Universal adversarial triggers - short token sequences that cause misclassification regardless of input.

Key Concepts

  • Adversarial triggers
  • Universal attacks
  • Transferable attacks
  • NLP vulnerabilities
  • Model robustness

Impact

Revealed fundamental vulnerability in NLP models

Category

Jailbreaks & Attacks