TY - RPRT TI - Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts AU - Haizhong Zheng AU - Yang Zhou AU - Brian R. Bartoldson AU - Bhavya Kailkhura AU - Fan Lai AU - Jiawei Zhao AU - Beidi Chen PY - 2025 UR - https://arxiv.org/abs/2506.02177 ID - 2506.02177 ER -