TY - RPRT TI - BRAIn: Bayesian Reward-conditioned Amortized Inference for natural language generation from feedback AU - Gaurav Pandey AU - Yatin Nandwani AU - Tahira Naseem AU - Mayank Mishra AU - Guangxuan Xu AU - Dinesh Raghu AU - Sachindra Joshi AU - Asim Munawar AU - Ramón Fernandez Astudillo PY - 2024 UR - https://arxiv.org/abs/2402.02479 ID - 2402.02479 ER -