TY - RPRT TI - Average-Reward Maximum Entropy Reinforcement Learning for Global Policy in Double Pendulum Tasks AU - Jean Seong Bjorn Choe AU - Bumkyu Choi AU - Jong-kook Kim PY - 2025 UR - https://arxiv.org/abs/2505.07516 ID - 2505.07516 ER -