TY - RPRT TI - Post-Training with Policy Gradients: Optimality and the Base Model Barrier AU - Alireza Mousavi-Hosseini AU - Murat A. Erdogdu PY - 2026 UR - https://arxiv.org/abs/2603.06957 ID - 2603.06957 ER -