TY - RPRT TI - Learning More with Less: A Dynamic Dual-Level Down-Sampling Framework for Efficient Policy Optimization AU - Chao Wang AU - Tao Yang AU - Hongtao Tian AU - Yunsheng Shi AU - Qiyao Ma AU - Xiaotao Liu AU - Ting Yao AU - Wenbo Ding PY - 2025 UR - https://arxiv.org/abs/2509.22115 ID - 2509.22115 ER -