TY - RPRT TI - Parameter Efficient Reinforcement Learning from Human Feedback AU - Hakim Sidahmed AU - Samrat Phatale AU - Alex Hutcheson AU - Zhuonan Lin AU - Zhang Chen AU - Zac Yu AU - Jarvis Jin AU - Simral Chaudhary AU - Roman Komarytsia AU - Christiane Ahlheim AU - Yonghao Zhu AU - Bowen Li AU - Saravanan Ganesh AU - Bill Byrne AU - Jessica Hoffmann AU - Hassan Mansoor AU - Wei Li AU - Abhinav Rastogi AU - Lucas Dixon PY - 2024 UR - https://arxiv.org/abs/2403.10704 ID - 2403.10704 ER -