DataShield: Safety-degrading Data Filtering for LLM Benign Instruction Fine-Tuning
DGX agentarXiv:2606.00160v1 Announce Type: cross Abstract: Large language models (LLMs) suffer from degraded safety capabilities even when fine-tuned with benign datasets. However, existing methods for identif