TY - RPRT TI - Entropy-Gated Selective Policy Optimization:Token-Level Gradient Allocation for Hybrid Training of Large Language Models AU - Yuelin Hu AU - Zhengxue Cheng AU - Wei Liu AU - Li Song PY - 2026 UR - https://arxiv.org/abs/2602.03309 ID - 2602.03309 ER -