TY - RPRT TI - Finite-Sample Analysis of Policy Evaluation for Robust Average Reward Reinforcement Learning AU - Yang Xu AU - Washim Uddin Mondal AU - Vaneet Aggarwal PY - 2025 UR - https://arxiv.org/abs/2502.16816 ID - 2502.16816 ER -