TY - RPRT TI - Learnable Game-theoretic Policy Optimization for Data-centric Self-explanation Rationalization AU - Yunxiao Zhao AU - Zhiqiang Wang AU - Xingtong Yu AU - Xiaoli Li AU - Jiye Liang AU - Ru Li PY - 2025 UR - https://arxiv.org/abs/2510.13393 ID - 2510.13393 ER -