TY - RPRT TI - Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents AU - Reuben Tan AU - Baolin Peng AU - Zhengyuan Yang AU - Hao Cheng AU - Oier Mees AU - Theodore Zhao AU - Andrea Tupini AU - Isar Meijer AU - Qianhui Wu AU - Yuncong Yang AU - Lars Liden AU - Yu Gu AU - Sheng Zhang AU - Xiaodong Liu AU - Lijuan Wang AU - Marc Pollefeys AU - Yong Jae Lee AU - Jianfeng Gao PY - 2026 UR - https://arxiv.org/abs/2512.03438 ID - 2512.03438 ER -