TY - RPRT TI - RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents AU - Zijing Zhang AU - Ziyang Chen AU - Mingxiao Li AU - Zhaopeng Tu AU - Xiaolong Li PY - 2025 UR - https://arxiv.org/abs/2507.22844 ID - 2507.22844 ER -