TY - RPRT TI - MuPHI: Learning Implicit Multimodal Harm Reasoning via Semantically Grounded Reward Optimization AU - Anisha Saha AU - Varsha Suresh AU - Teodora Kamova AU - Sophia Wiedmann AU - Timothy Hospedales AU - Vera Demberg PY - 2026 UR - https://arxiv.org/abs/2605.29951 ID - 2605.29951 ER -