TY - RPRT TI - Generalizing Beyond Suboptimality: Offline Reinforcement Learning Learns Effective Scheduling through Random Solutions AU - Jesse van Remmerden AU - Zaharah Bukhsh AU - Yingqian Zhang PY - 2026 UR - https://arxiv.org/abs/2509.10303 ID - 2509.10303 ER -