TY - RPRT TI - S-GRPO: Unified Post-Training for Large Vision-Language Models AU - Yuming Yan AU - Kai Tang AU - Sihong Chen AU - Ke Xu AU - Dan Hu AU - Qun Yu AU - Pengfei Hu PY - 2026 UR - https://arxiv.org/abs/2604.16557 ID - 2604.16557 ER -