TY - RPRT TI - Long-Horizon Model-Based Offline Reinforcement Learning Without Explicit Conservatism AU - Tianwei Ni AU - Esther Derman AU - Vineet Jain AU - Vincent Taboga AU - Siamak Ravanbakhsh AU - Pierre-Luc Bacon PY - 2026 UR - https://arxiv.org/abs/2512.04341 ID - 2512.04341 ER -