TY - RPRT TI - Pairwise Proximal Policy Optimization: Harnessing Relative Feedback for LLM Alignment AU - Tianhao Wu AU - Banghua Zhu AU - Ruoyu Zhang AU - Zhaojin Wen AU - Kannan Ramchandran AU - Jiantao Jiao PY - 2023 UR - https://arxiv.org/abs/2310.00212 ID - 2310.00212 ER -