@misc{indiciae4fad704fd355, title = {Balancing the Reasoning Load: Difficulty-Differentiated Policy Optimization with Length Redistribution for Efficient and Robust Reinforcement Learning}, author = {Yinan Xia and Haotian Zhang and Huiming Wang}, year = {2026}, url = {https://arxiv.org/abs/2603.18533}, note = {Source identifier: 2603.18533} }