TY - RPRT TI - Learning from Unreachable Rewards: Hint-Conditioned Reinforcement Learning for Generative Recommendation AU - Kangning Zhang AU - Haotian Fang AU - Xukun Luo AU - Hao Yin AU - Yang Gao AU - Peng Yan AU - Weiwen Liu AU - Weinan Zhang AU - Yong Yu PY - 2026 DO - 10.1145/3799682.3840842 UR - https://arxiv.org/abs/2608.11980 ID - 2608.11980 ER -