TY - RPRT TI - ProRL: Effective Reinforcement Learning for Proactive Recommendation via Rectified Policy Gradient Estimation AU - Hongru Hou AU - Tiehua Mei AU - Denghui Geng AU - Jinhui Huang AU - Ao Xu AU - Hengrui Chen AU - Jiaqing Liang AU - Deqing Yang PY - 2026 UR - https://arxiv.org/abs/2605.28293 ID - 2605.28293 ER -