TY - RPRT TI - APLOT: Robust Reward Modeling via Adaptive Preference Learning with Optimal Transport AU - Zhuo Li AU - Yuege Feng AU - Dandan Guo AU - Jinpeng Hu AU - Anningzhe Gao AU - Xiang Wan PY - 2025 UR - https://arxiv.org/abs/2510.10963 ID - 2510.10963 ER -