Patcher: Post-Hoc Patching of Backdoored Large Language Models
arXiv:2606.02995v1 Announce Type: cross Abstract: Large language models remain vulnerable to jailbreak backdoor attacks, where adversaries poison safety alignment data to embed hidden triggers that by