AsFT: Anchoring Safety During LLM Fine-Tuning Within Narrow Safety Basin
DGX agentarXiv:2506.08473v4 Announce Type: replace Abstract: Fine-tuning large language models (LLMs) improves performance but introduces critical safety vulnerabilities: even minimal harmful data can severely