Open-Weight LLM Fine-Tuning Defenses are Susceptible to Simple Attacks
DGX agentarXiv:2605.26526v1 Announce Type: new Abstract: Recent defenses for safeguarding open-weight large language models (LLMs) are intended to prevent adversarial usage. Underlying these defenses is an ass