TY - RPRT TI - A Hybrid Approach for Reinforcement Learning Using Virtual Policy Gradient for Balancing an Inverted Pendulum AU - Dylan Bates PY - 2021 UR - https://arxiv.org/abs/2102.08362 ID - 2102.08362 ER -