TY - RPRT TI - POLO: Preference-Guided Multi-Turn Reinforcement Learning for Lead Optimization AU - Ziqing Wang AU - Yibo Wen AU - William Pattie AU - Xiao Luo AU - Weimin Wu AU - Jerry Yao-Chieh Hu AU - Abhishek Pandey AU - Han Liu AU - Kaize Ding PY - 2025 UR - https://arxiv.org/abs/2509.21737 ID - 2509.21737 ER -