TY - RPRT TI - Performative Policy Gradient: Optimality in Performative Reinforcement Learning AU - Debabrota Basu AU - Udvas Das AU - Brahim Driss AU - Uddalak Mukherjee PY - 2026 UR - https://arxiv.org/abs/2512.20576 ID - 2512.20576 ER -