TY - RPRT TI - Learning Preference Adaptation for Large Language Model Personalization via Verbal Reinforcement Learning AU - Yuting Liu AU - Wei Wu AU - Jianzhe Zhao AU - Guibing Guo PY - 2026 UR - https://arxiv.org/abs/2608.09507 ID - 2608.09507 ER -