TY - RPRT TI - Group Distributionally Robust Optimization-Driven Reinforcement Learning for LLM Reasoning AU - Kishan Panaganti AU - Zhenwen Liang AU - Wenhao Yu AU - Haitao Mi AU - Dong Yu PY - 2026 UR - https://arxiv.org/abs/2601.19280 ID - 2601.19280 ER -