@misc{indiciaefc9ce6822d81, title = {RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents}, author = {Zijing Zhang and Ziyang Chen and Mingxiao Li and Zhaopeng Tu and Xiaolong Li}, year = {2025}, url = {https://arxiv.org/abs/2507.22844}, note = {Source identifier: 2507.22844} }