TY - RPRT TI - LearnAlign: Data Selection for LLM Reinforcement Learning with Improved Gradient Alignment AU - Shipeng Li AU - Zhiqin Yang AU - Shikun Li AU - Xiaobo Xia AU - Hengyu Liu AU - Xinghua Zhang AU - Gaode Chen AU - Dong Fang AU - Ying Tai AU - Zhe Peng PY - 2026 UR - https://arxiv.org/abs/2506.11480 ID - 2506.11480 ER -