TY - RPRT TI - Towards Sample-Efficient and Stable Reinforcement Learning for LLM-based Recommendation AU - Hongxun Ding AU - Keqin Bao AU - Jizhi Zhang AU - Yi Fang AU - Wenxin Xu AU - Fuli Feng AU - Xiangnan He PY - 2026 UR - https://arxiv.org/abs/2602.00632 ID - 2602.00632 ER -