TY - RPRT TI - Reinforcement Learning from Multi-role Debates as Feedback for Bias Mitigation in LLMs AU - Ruoxi Cheng AU - Haoxuan Ma AU - Shuirong Cao AU - Jiaqi Li AU - Aihua Pei AU - Zhiqiang Wang AU - Pengliang Ji AU - Haoyu Wang AU - Jiaqi Huo PY - 2024 UR - https://arxiv.org/abs/2404.10160 ID - 2404.10160 ER -