TY - RPRT TI - PA2D-MORL: Pareto Ascent Directional Decomposition based Multi-Objective Reinforcement Learning AU - Tianmeng Hu AU - Biao Luo PY - 2026 DO - 10.1609/aaai.v38i11.29148 UR - https://arxiv.org/abs/2603.19579 ID - 2603.19579 ER -