@misc{indiciae3c3cbf5fa176, title = {RVI-SAC: Average Reward Off-Policy Deep Reinforcement Learning}, author = {Yukinari Hisaki and Isao Ono}, year = {2024}, url = {https://arxiv.org/abs/2408.01972}, note = {Source identifier: 2408.01972} }