TY - RPRT TI - Parallel Heuristic Search as Inference for Actor-Critic Reinforcement Learning Models AU - Hanlan Yang AU - Itamar Mishani AU - Luca Pivetti AU - Zachary Kingston AU - Maxim Likhachev PY - 2025 UR - https://arxiv.org/abs/2509.25402 ID - 2509.25402 ER -