TY - RPRT TI - Test-Time Preference Optimization: On-the-Fly Alignment via Iterative Textual Feedback AU - Yafu Li AU - Xuyang Hu AU - Xiaoye Qu AU - Linjie Li AU - Yu Cheng PY - 2025 UR - https://arxiv.org/abs/2501.12895 ID - 2501.12895 ER -