TY - RPRT TI - DiffOP: Reinforcement Learning of Optimization-Based Control Policies via Implicit Policy Gradients AU - Yuexin Bian AU - Jie Feng AU - Yuanyuan Shi PY - 2025 UR - https://arxiv.org/abs/2411.07484 ID - 2411.07484 ER -