ClaHF: A Human Feedback-inspired Reinforcement Learning Framework for Improving Classification Tasks
DGX agentarXiv:2605.17458v1 Announce Type: new Abstract: Text classification models are typically trained via supervised fine-tuning (SFT). However, SFT essentially performs behavior cloning from instance-wise