TY - RPRT TI - Scalable Multi-Objective and Meta Reinforcement Learning via Gradient Estimation AU - Zhenshuo Zhang AU - Minxuan Duan AU - Youran Ye AU - Hongyang R. Zhang PY - 2026 UR - https://arxiv.org/abs/2511.12779 ID - 2511.12779 ER -