TY - RPRT TI - Effective Reinforcement Learning for Reasoning in Language Models AU - Lianghuan Huang AU - Shuo Li AU - Sagnik Anupam AU - Insup Lee AU - Osbert Bastani PY - 2025 UR - https://arxiv.org/abs/2505.17218 ID - 2505.17218 ER -