TY - RPRT TI - TLPO: Token-Level Policy Optimization for Mitigating Language Confusion in Large Language Models AU - Jinho Choo AU - JunSeung Lee AU - Jimyeong Kim AU - Yeeho Song AU - S. K. Hong AU - Yeong-Dae Kwon PY - 2026 UR - https://arxiv.org/abs/2604.26553 ID - 2604.26553 ER -