TY - RPRT TI - Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency AU - Hongyu Li AU - Songhao Han AU - Yue Liao AU - Junfeng Luo AU - Jialin Gao AU - Shuicheng Yan AU - Si Liu PY - 2025 UR - https://arxiv.org/abs/2506.01908 ID - 2506.01908 ER -