TY - RPRT TI - Loose lips sink ships: Mitigating Length Bias in Reinforcement Learning from Human Feedback AU - Wei Shen AU - Rui Zheng AU - Wenyu Zhan AU - Jun Zhao AU - Shihan Dou AU - Tao Gui AU - Qi Zhang AU - Xuanjing Huang PY - 2023 UR - https://arxiv.org/abs/2310.05199 ID - 2310.05199 ER -