TY - RPRT TI - Pareto-Optimal Offline Reinforcement Learning via Smooth Tchebycheff Scalarization AU - Aadyot Bhatnagar AU - Peter Mørch Groth AU - Sebastian Ibarraran AU - Ali Madani PY - 2026 UR - https://arxiv.org/abs/2604.13175 ID - 2604.13175 ER -