TY - RPRT TI - XQC: Well-conditioned Optimization Accelerates Deep Reinforcement Learning AU - Daniel Palenicek AU - Florian Vogt AU - Joe Watson AU - Ingmar Posner AU - Jan Peters PY - 2026 UR - https://arxiv.org/abs/2509.25174 ID - 2509.25174 ER -