TY - RPRT TI - Rank-GRPO: Training LLM-based Conversational Recommender Systems with Reinforcement Learning AU - Yaochen Zhu AU - Harald Steck AU - Dawen Liang AU - Yinhan He AU - Vito Ostuni AU - Jundong Li AU - Nathan Kallus PY - 2026 UR - https://arxiv.org/abs/2510.20150 ID - 2510.20150 ER -