TY - RPRT TI - Safe RLHF-V: Safe Reinforcement Learning from Multi-modal Human Feedback AU - Jiaming Ji AU - Xinyu Chen AU - Rui Pan AU - Conghui Zhang AU - Han Zhu AU - Jiahao Li AU - Donghai Hong AU - Boyuan Chen AU - Jiayi Zhou AU - Kaile Wang AU - Juntao Dai AU - Chi-Min Chan AU - Yida Tang AU - Sirui Han AU - Yike Guo AU - Yaodong Yang PY - 2025 UR - https://arxiv.org/abs/2503.17682 ID - 2503.17682 ER -