TY - RPRT TI - h1: Bootstrapping LLMs to Reason over Longer Horizons via Reinforcement Learning AU - Sumeet Ramesh Motwani AU - Alesia Ivanova AU - Ziyang Cai AU - Philip Torr AU - Riashat Islam AU - Shital Shah AU - Christian Schroeder de Witt AU - Charles London PY - 2025 UR - https://arxiv.org/abs/2510.07312 ID - 2510.07312 ER -