TY - RPRT TI - Complexity scaling and optimal policy degeneracy in quantum reinforcement learning via analytically solvable unitary-control-then-measure models AU - Andrea Cintio AU - Alessandro Michelangeli AU - Dmitrii Tsutskov PY - 2026 UR - https://arxiv.org/abs/2604.13096 ID - 2604.13096 ER -