TY - RPRT TI - Causally Robust Reward Learning from Reason-Augmented Preference Feedback AU - Minjune Hwang AU - Yigit Korkmaz AU - Daniel Seita AU - Erdem Bıyık PY - 2026 UR - https://arxiv.org/abs/2603.04861 ID - 2603.04861 ER -