TY - RPRT TI - RAPID: An Efficient Reinforcement Learning Algorithm for Small Language Models AU - Lianghuan Huang AU - Sagnik Anupam AU - Insup Lee AU - Shuo Li AU - Osbert Bastani PY - 2025 UR - https://arxiv.org/abs/2510.03515 ID - 2510.03515 ER -