TY - RPRT TI - MAESTRO: Meta-learning Adaptive Estimation of Scalarization Trade-offs for Reward Optimization AU - Yang Zhao AU - Hepeng Wang AU - Xiao Ding AU - Yangou Ouyang AU - Bibo Cai AU - Kai Xiong AU - Jinglong Gao AU - Zhouhao Sun AU - Li Du AU - Bing Qin AU - Ting Liu PY - 2026 UR - https://arxiv.org/abs/2601.07208 ID - 2601.07208 ER -