TY - RPRT TI - Sample-Efficient Tabular Self-Play for Offline Robust Reinforcement Learning AU - Na Li AU - Zewu Zheng AU - Wei Ni AU - Hangguan Shan AU - Wenjie Zhang AU - Xinyu Li PY - 2025 UR - https://arxiv.org/abs/2512.00352 ID - 2512.00352 ER -