TY - RPRT TI - Reinforcement Learning from Adversarial Preferences in Tabular MDPs AU - Taira Tsuchiya AU - Shinji Ito AU - Haipeng Luo PY - 2025 UR - https://arxiv.org/abs/2507.11706 ID - 2507.11706 ER -