TY - RPRT TI - A Harmonic Mean Formulation of Average Reward Reinforcement Learning in SMDPs AU - Erel Shtossel AU - Alicia Vidler AU - Uri Shaham AU - Gal A. Kaminka PY - 2026 UR - https://arxiv.org/abs/2605.04880 ID - 2605.04880 ER -