TY - RPRT TI - Reinforcement Learning with Semantic Rewards Enables Low-Resource Language Expansion without Alignment Tax AU - Zeli Su AU - Ziyin Zhang AU - Zhou Liu AU - Xuexian Song AU - Zhankai Xu AU - Longfei Zheng AU - Xiaolu Zhang AU - Rong Fu AU - Guixian Xu AU - Wentao Zhang PY - 2026 UR - https://arxiv.org/abs/2605.14366 ID - 2605.14366 ER -