TY - RPRT TI - RLVR without Ineffective Samples: Group Prioritized Off-Policy Optimization for LLM Reasoning AU - Yixiu Mao AU - Yun Qu AU - Qi Wang AU - Heming Zou AU - Xiangyang Ji PY - 2026 UR - https://arxiv.org/abs/2606.01281 ID - 2606.01281 ER -