TY - RPRT TI - Shop-R1: Rewarding LLMs to Simulate Human Behavior in Online Shopping via Reinforcement Learning AU - Yimeng Zhang AU - Tian Wang AU - Jiri Gesi AU - Ziyi Wang AU - Yuxuan Lu AU - Jiacheng Lin AU - Sinong Zhan AU - Vianne Gao AU - Ruochen Jiao AU - Junze Liu AU - Kun Qian AU - Yuxin Tang AU - Ran Xue AU - Houyu Zhang AU - Qingjun Cui AU - Yufan Guo AU - Dakuo Wang PY - 2026 UR - https://arxiv.org/abs/2507.17842 ID - 2507.17842 ER -