TY - RPRT TI - Learning Ordinal Probabilistic Reward from Preferences AU - Longze Chen AU - Lu Wang AU - Renke Shan AU - Ze Gong AU - Run Luo AU - Jiaming Li AU - Jing Luo AU - Qiyao Wang AU - Min Yang PY - 2026 UR - https://arxiv.org/abs/2602.12660 ID - 2602.12660 ER -