TY - RPRT TI - Efficient Reinforcement Learning from Human Feedback via Bayesian Preference Inference AU - Matteo Cercola AU - Valeria Capretti AU - Simone Formentin PY - 2025 UR - https://arxiv.org/abs/2511.04286 ID - 2511.04286 ER -