TY - RPRT TI - RVI-SAC: Average Reward Off-Policy Deep Reinforcement Learning AU - Yukinari Hisaki AU - Isao Ono PY - 2024 UR - https://arxiv.org/abs/2408.01972 ID - 2408.01972 ER -