TY - RPRT TI - MA-RLHF: Reinforcement Learning from Human Feedback with Macro Actions AU - Yekun Chai AU - Haoran Sun AU - Huang Fang AU - Shuohuan Wang AU - Yu Sun AU - Hua Wu PY - 2025 UR - https://arxiv.org/abs/2410.02743 ID - 2410.02743 ER -