TY - RPRT TI - Learning Guarantee of Reward Modeling Using Deep Neural Networks AU - Yuanhang Luo AU - Yeheng Ge AU - Ruijian Han AU - Guohao Shen PY - 2025 UR - https://arxiv.org/abs/2505.06601 ID - 2505.06601 ER -