TY - RPRT TI - CiPO: Counterfactual Unlearning for Large Reasoning Models through Iterative Preference Optimization AU - Junyi Li AU - Yongqiang Chen AU - Ningning Ding PY - 2026 UR - https://arxiv.org/abs/2604.15847 ID - 2604.15847 ER -