@misc{indiciae8ecc59674a3d, title = {Semi-Supervised Reward Modeling via Iterative Self-Training}, author = {Yifei He and Haoxiang Wang and Ziyan Jiang and Alexandros Papangelis and Han Zhao}, year = {2024}, url = {https://arxiv.org/abs/2409.06903}, note = {Source identifier: 2409.06903} }