TY - RPRT TI - SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning AU - Carlo Romeo AU - Girolamo Macaluso AU - Alessandro Sestini AU - Andrew D. Bagdanov PY - 2025 UR - https://arxiv.org/abs/2501.08669 ID - 2501.08669 ER -