TY - RPRT TI - DiffPO: Diffusion-styled Preference Optimization for Efficient Inference-Time Alignment of Large Language Models AU - Ruizhe Chen AU - Wenhao Chai AU - Zhifei Yang AU - Xiaotian Zhang AU - Joey Tianyi Zhou AU - Tony Quek AU - Soujanya Poria AU - Zuozhu Liu PY - 2025 UR - https://arxiv.org/abs/2503.04240 ID - 2503.04240 ER -