Beyond Forgetting: Machine Unlearning Elicits Controllable Side Behaviors and Capabilities
arXiv:2601.21702v3 Announce Type: replace-cross Abstract: We consider Representation Misdirection (RM), a class of large language model (LLM) unlearning methods that achieve forgetting by redirecting