TY - RPRT TI - Reinforcement Learning for Compositional Generalization with Outcome-Level Optimization AU - Xiyan Fu AU - Wei Liu PY - 2026 UR - https://arxiv.org/abs/2605.04920 ID - 2605.04920 ER -