TY - RPRT TI - Random Policy Valuation is Enough for LLM Reasoning with Verifiable Rewards AU - Haoran He AU - Yuxiao Ye AU - Qingpeng Cai AU - Chen Hu AU - Binxing Jiao AU - Daxin Jiang AU - Ling Pan PY - 2025 UR - https://arxiv.org/abs/2509.24981 ID - 2509.24981 ER -