Gradient Immunity: Null-Space Resistance to Malicious Fine-Tuning
DGX agentarXiv:2608.05045v1 Announce Type: cross Abstract: Released aligned large language models remain vulnerable to malicious downstream finetuning. Existing defenses are largely designed for the fine-tunin