TY - RPRT TI - From Correctness to Preference: A Framework for Personalized Agentic Reinforcement Learning AU - Ranxu zhang AU - zeyang li AU - Jiacheng Huang AU - Rui Zhang AU - Xiaozhou Xu AU - sun zhe AU - Yanyong Zhang AU - Chao Wang PY - 2026 UR - https://arxiv.org/abs/2605.23382 ID - 2605.23382 ER -