TY - RPRT TI - Alternating Reinforcement Learning for Rubric-Based Reward Modeling in Non-Verifiable LLM Post-Training AU - Ran Xu AU - Tianci Liu AU - Zihan Dong AU - Tony Yu AU - Ilgee Hong AU - Carl Yang AU - Linjun Zhang AU - Tao Zhao AU - Haoyu Wang PY - 2026 UR - https://arxiv.org/abs/2602.01511 ID - 2602.01511 ER -