S-GRPO: Unified Post-Training for Large Vision-Language Models
DGX agentarXiv:2604.16557v1 Announce Type: cross Abstract: Current post-training methodologies for adapting Large Vision-Language Models (LVLMs) generally fall into two paradigms: Supervised Fine-Tuning (SFT)