TY - RPRT TI - Approximated Variational Bayesian Inverse Reinforcement Learning for Large Language Model Alignment AU - Yuang Cai AU - Yuyu Yuan AU - Jinsheng Shi AU - Qinhong Lin PY - 2024 UR - https://arxiv.org/abs/2411.09341 ID - 2411.09341 ER -