@misc{indiciaead810dc395cb, title = {Personalizing Reinforcement Learning from Human Feedback with Variational Preference Learning}, author = {Sriyash Poddar and Yanming Wan and Hamish Ivison and Abhishek Gupta and Natasha Jaques}, year = {2024}, url = {https://arxiv.org/abs/2408.10075}, note = {Source identifier: 2408.10075} }