TY - RPRT TI - Alternating Reinforcement Learning with Contextual Rubric Rewards: Beyond the Scalarization Strategy AU - Guangchen Lan AU - Lian Xiong AU - Xin Zhou AU - Hejie Cui AU - Yuwei Zhang AU - Mao Li AU - Zhenyu Shi AU - Besnik Fetahu AU - Lihong Li AU - Xian Li PY - 2026 UR - https://arxiv.org/abs/2603.15646 ID - 2603.15646 ER -