TY - RPRT TI - S-SPPO: Semantic-Calibrated Self-Play Preference Optimization AU - Xiwen Chen AU - Wenhui Zhu AU - Jingjing Wang AU - Peijie Qiu AU - Zhipeng Wang AU - Huayu Li AU - ZhengXiao He AU - Xuanzhao Dong AU - Prayag Tiwari AU - Mingkun Xu AU - Yujian Xiong AU - Feng Luo AU - Abolfazl Razi AU - Brendan Hogan Rappazzo AU - Anderson Schneider AU - Yuriy Nevmyvaka PY - 2026 UR - https://arxiv.org/abs/2606.01561 ID - 2606.01561 ER -