TY - RPRT TI - Multi-Fidelity Policy Gradients Stabilize Data-Scarce Reinforcement Learning AU - Xinjie Liu AU - Ruihan Zhao AU - Anirban Chaudhuri AU - Cyrus Neary AU - Ufuk Topcu AU - David Fridovich-Keil PY - 2026 UR - https://arxiv.org/abs/2610.02505 ID - 2610.02505 ER -