TY - RPRT TI - A Relative-Budget Theory for Reinforcement Learning with Verifiable Rewards in Large Language Model Reasoning AU - Akifumi Wachi AU - Hirota Kinoshita AU - Shokichi Takakura AU - Rei Higuchi AU - Taiji Suzuki PY - 2026 UR - https://arxiv.org/abs/2602.01523 ID - 2602.01523 ER -