TY - RPRT TI - An Optimal Policy for Learning Controllable Dynamics by Exploration AU - Peter N. Loxley PY - 2025 UR - https://arxiv.org/abs/2512.20053 ID - 2512.20053 ER -