Fine-Tuning Without Forgetting via Loss-Adaptive Learning Rates
arXiv:2605.20005v1 Announce Type: new Abstract: Fine-tuning large language models on new data improves task performance but degrades capabilities learned during pretraining, a phenomenon known as cata