Safety
Reinforcement Learning Improves LLM Accuracy and Reasoning in Disease Classification from Radiology Reports
arXiv:2604.19060v1 Announce Type: new Abstract: Accurate disease classification from radiology reports is essential for many applications. While supervised fine-tuning (SFT) of lightweight LLMs improv
arXiv:2604.19060v1 Announce Type: new Abstract: Accurate disease classification from radiology reports is essential for many applications. While supervised fine-tuning (SFT) of lightweight LLMs improves accuracy, it can degrade reasoning. We propose a two-stage approach: SFT on disease labels followed by Group Relative Policy Optimization (GRPO) to refine predictions by optimizing accuracy and format without reasoning supervision. Across three radiologist-annotated datasets, SFT outperformed baselines and GRPO further improved classification and enhanced reasoning recall and comprehensiveness.
Related
- Consolidation or Adaptation? PRISM: Disentangling SFT and RL Data via Gradient Concentration
- StaRPO: Stability-Augmented Reinforcement Policy Optimization
- Bridging SFT and RL: Dynamic Policy Optimization for Robust Reasoning
- Rethinking Generalization in Reasoning SFT: A Conditional Analysis on Optimization, Data, and Model Capability
- Targeted Exploration via Unified Entropy Control for Reinforcement Learning
Source: arXiv cs.AI | 2026-04-22