TY - RPRT TI - GSRM: Generative Speech Reward Model for Speech RLHF AU - Maohao Shen AU - Tejas Jayashankar AU - Osama Hanna AU - Naoyuki Kanda AU - Yancheng Wang AU - Kateřina Žmolíková AU - Ruiming Xie AU - Niko Moritz AU - Anfeng Xu AU - Yashesh Gaur AU - Gregory Wornell AU - Qing He AU - Jilong Wu PY - 2026 UR - https://arxiv.org/abs/2602.13891 ID - 2602.13891 ER -