arXiv · 2302.05120
Step by Step Loss Goes Very Far: Multi-Step Quantization for Adversarial Text Attacks
Abstract
We propose a novel gradient-based attack against transformer-based language models that searches for an adversarial example in a continuous space of token probabilities. Our algorithm mitigates the gap between adversarial loss for continuous and discrete text representations by performing multi-step quantization in a quantization-compensation loop. Experiments show that our method significantly outperforms other approaches on various natural language processing (NLP) tasks.
Explore related subjects
Keep this discovery
Piotr Gaiński, Klaudia Bałazy. 2023-02-10. Step by Step Loss Goes Very Far: Multi-Step Quantization for Adversarial Text Attacks. https://arxiv.org/abs/2302.05120
Cite the original work for its findings. Save a collection to share your selection of sources.