TY - RPRT TI - Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions AU - Mingyi Li AU - Taira Tsuchiya AU - Kenji Yamanishi PY - 2026 UR - https://arxiv.org/abs/2606.31769 ID - 2606.31769 ER -