TY - RPRT TI - Balancing the Reasoning Load: Difficulty-Differentiated Policy Optimization with Length Redistribution for Efficient and Robust Reinforcement Learning AU - Yinan Xia AU - Haotian Zhang AU - Huiming Wang PY - 2026 UR - https://arxiv.org/abs/2603.18533 ID - 2603.18533 ER -