TY - RPRT TI - QPO: Query-dependent Prompt Optimization via Multi-Loop Offline Reinforcement Learning AU - Yilun Kong AU - Hangyu Mao AU - Qi Zhao AU - Bin Zhang AU - Jingqing Ruan AU - Li Shen AU - Yongzhe Chang AU - Xueqian Wang AU - Rui Zhao AU - Dacheng Tao PY - 2025 UR - https://arxiv.org/abs/2408.10504 ID - 2408.10504 ER -