TY - RPRT TI - Reinforcement Learning with Multi-Step Lookahead Information Via Adaptive Batching AU - Nadav Merlis PY - 2026 UR - https://arxiv.org/abs/2601.10418 ID - 2601.10418 ER -