TY - RPRT TI - REBEL: Reinforcement Learning via Regressing Relative Rewards AU - Zhaolin Gao AU - Jonathan D. Chang AU - Wenhao Zhan AU - Owen Oertell AU - Gokul Swamy AU - Kianté Brantley AU - Thorsten Joachims AU - J. Andrew Bagnell AU - Jason D. Lee AU - Wen Sun PY - 2024 UR - https://arxiv.org/abs/2404.16767 ID - 2404.16767 ER -