TY - RPRT TI - TSO: Self-Training with Scaled Preference Optimization AU - Kaihui Chen AU - Hao Yi AU - Qingyang Li AU - Tianyu Qi AU - Yulan Hu AU - Fuzheng Zhang AU - Yong Liu PY - 2024 UR - https://arxiv.org/abs/2409.02118 ID - 2409.02118 ER -