TY - RPRT TI - Listening to the Echo: User-Reaction Aware Policy Optimization via Scalar-Verbal Hybrid Reinforcement Learning AU - Jing Ye AU - Xinpei Zhao AU - Lu Xiang AU - Yaping Zhang AU - Chengqing Zong PY - 2026 UR - https://arxiv.org/abs/2603.15434 ID - 2603.15434 ER -