TY - RPRT TI - Search-Based Adversarial Estimates for Improving Sample Efficiency in Off-Policy Reinforcement Learning AU - Federico Malato AU - Ville Hautamaki PY - 2025 UR - https://arxiv.org/abs/2502.01558 ID - 2502.01558 ER -