Optimus: A Robust Defense Framework for Mitigating Toxicity while Fine-Tuning Conversational AI
DGX agentarXiv:2507.05660v3 Announce Type: replace-cross Abstract: Customizing Large Language Models (LLMs) on untrusted datasets poses severe risks of injecting toxic behaviors. In this work, we introduce Opt