TY - RPRT TI - Learning Policy from a Single Trajectory in Average-Reward Markov Decision Process AU - Jongmin Lee AU - Ernest K. Ryu AU - Vaneet Aggarwal PY - 2026 UR - https://arxiv.org/abs/2606.16729 ID - 2606.16729 ER -