Defending Against Harmful Supervision Hidden in Benign Samples
DGX agentarXiv:2606.30263v1 Announce Type: cross Abstract: Existing defenses are effective when harmful content is explicitly mixed into downstream fine-tuning data, but crafted samples can instead hide harmfu