TY - RPRT TI - Reward Balancing Revisited: Enhancing Offline Reinforcement Learning for Recommender Systems AU - Wenzheng Shu AU - Yanxiang Zeng AU - Yongxiang Tang AU - Teng Sha AU - Ning Luo AU - Yanhua Cheng AU - Xialong Liu AU - Fan Zhou AU - Peng Jiang PY - 2025 DO - 10.1145/3701716.3715547 UR - https://arxiv.org/abs/2506.22112 ID - 2506.22112 ER -