TY - RPRT TI - LongReward: Improving Long-context Large Language Models with AI Feedback AU - Jiajie Zhang AU - Zhongni Hou AU - Xin Lv AU - Shulin Cao AU - Zhenyu Hou AU - Yilin Niu AU - Lei Hou AU - Yuxiao Dong AU - Ling Feng AU - Juanzi Li PY - 2024 UR - https://arxiv.org/abs/2410.21252 ID - 2410.21252 ER -