@misc{indiciae3eb1d85364c2, title = {Alternating Reinforcement Learning for Rubric-Based Reward Modeling in Non-Verifiable LLM Post-Training}, author = {Ran Xu and Tianci Liu and Zihan Dong and Tony Yu and Ilgee Hong and Carl Yang and Linjun Zhang and Tao Zhao and Haoyu Wang}, year = {2026}, url = {https://arxiv.org/abs/2602.01511}, note = {Source identifier: 2602.01511} }