TY - RPRT TI - Fairness Begins with State: Purifying Latent Preferences for Hierarchical Reinforcement Learning in Interactive Recommendation AU - Yun Lu AU - Xiaoyu Shi AU - Hong Xie AU - Xiangyu Zhao AU - Mingsheng Shang PY - 2026 UR - https://arxiv.org/abs/2603.03820 ID - 2603.03820 ER -