TY - RPRT TI - Multi-Task Reinforcement Learning for Enhanced Multimodal LLM-as-a-Judge AU - Junjie Wu AU - Xuan Kan AU - Zihao He AU - Shunwen Tan AU - Bo Pan AU - Kaitai Zhang PY - 2026 UR - https://arxiv.org/abs/2603.11665 ID - 2603.11665 ER -