TY - RPRT TI - Regret-Optimal Q-Learning with Low Cost for Single-Agent and Federated Reinforcement Learning AU - Haochen Zhang AU - Zhong Zheng AU - Lingzhou Xue PY - 2026 UR - https://arxiv.org/abs/2506.04626 ID - 2506.04626 ER -