TY - RPRT TI - Counterfactual Self-Questioning for Stable Policy Optimization in Language Models AU - Mandar Parab PY - 2025 UR - https://arxiv.org/abs/2601.00885 ID - 2601.00885 ER -