TY - RPRT TI - GradAlign: Gradient-Aligned Data Selection for LLM Reinforcement Learning AU - Ningyuan Yang AU - Weihua Du AU - Weiwei Sun AU - Sean Welleck AU - Yiming Yang PY - 2026 UR - https://arxiv.org/abs/2602.21492 ID - 2602.21492 ER -