TY - RPRT TI - Multi-Step Likelihood-Ratio Correction for Reinforcement Learning with Verifiable Rewards AU - Deokgyu Yoon AU - Hyungkyu Kang AU - Joongkyu Lee AU - Byeongchan Kim AU - Gyungin Shin AU - Sungrae Park AU - Min-hwan Oh PY - 2026 UR - https://arxiv.org/abs/2605.20865 ID - 2605.20865 ER -