TY - RPRT TI - GAPO: Learning Preferential Prompt through Generative Adversarial Policy Optimization AU - Zhouhong Gu AU - Xingzhou Chen AU - Xiaoran Shi AU - Tao Wang AU - Suhang Zheng AU - Tianyu Li AU - Hongwei Feng AU - Yanghua Xiao PY - 2025 UR - https://arxiv.org/abs/2503.20194 ID - 2503.20194 ER -