TY - RPRT TI - Trust Region Preference Approximation: A simple and stable reinforcement learning algorithm for LLM reasoning AU - Xuerui Su AU - Shufang Xie AU - Guoqing Liu AU - Yingce Xia AU - Renqian Luo AU - Peiran Jin AU - Zhiming Ma AU - Yue Wang AU - Zun Wang AU - Yuting Liu PY - 2025 UR - https://arxiv.org/abs/2504.04524 ID - 2504.04524 ER -