TY - RPRT TI - Regularized Reward-Punishment Reinforcement Learning AU - Jiexin Wang AU - Eiji Uchibe PY - 2026 UR - https://arxiv.org/abs/2606.28152 ID - 2606.28152 ER -