TY - RPRT TI - H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning AU - Eric Peh AU - Debaditya Roy AU - Basura Fernando PY - 2026 UR - https://arxiv.org/abs/2606.29915 ID - 2606.29915 ER -