TY - RPRT TI - Scaling Off-Policy Reinforcement Learning with Batch and Weight Normalization AU - Daniel Palenicek AU - Florian Vogt AU - Joe Watson AU - Jan Peters PY - 2025 UR - https://arxiv.org/abs/2502.07523 ID - 2502.07523 ER -