TY - RPRT TI - Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes AU - Jonas Ehrhardt AU - René Heesch AU - Oliver Niggemann PY - 2026 UR - https://arxiv.org/abs/2607.12924 ID - 2607.12924 ER -