TY - RPRT TI - Multi-objective Reinforcement Learning with Nonlinear Preferences: Provable Approximation for Maximizing Expected Scalarized Return AU - Nianli Peng AU - Muhang Tian AU - Brandon Fain PY - 2025 UR - https://arxiv.org/abs/2311.02544 ID - 2311.02544 ER -