Toward Understanding the Transferability of Adversarial Suffixes in Large Language Models
DGX agentarXiv:2510.22014v2 Announce Type: replace-cross Abstract: Discrete optimization-based jailbreaking attacks on large language models aim to generate short, nonsensical suffixes that, when appended onto