TY - RPRT TI - Efficient On-Policy Reinforcement Learning via Exploration of Sparse Parameter Space AU - Xinyu Zhang AU - Aishik Deb AU - Klaus Mueller PY - 2025 UR - https://arxiv.org/abs/2509.25876 ID - 2509.25876 ER -