@misc{indiciaea1c02b685158, title = {Multi-Step Likelihood-Ratio Correction for Reinforcement Learning with Verifiable Rewards}, author = {Deokgyu Yoon and Hyungkyu Kang and Joongkyu Lee and Byeongchan Kim and Gyungin Shin and Sungrae Park and Min-hwan Oh}, year = {2026}, url = {https://arxiv.org/abs/2605.20865}, note = {Source identifier: 2605.20865} }