@misc{indiciaec89688b9c759, title = {Reinforcement Learning from Adversarial Preferences in Tabular MDPs}, author = {Taira Tsuchiya and Shinji Ito and Haipeng Luo}, year = {2025}, url = {https://arxiv.org/abs/2507.11706}, note = {Source identifier: 2507.11706} }