TY - RPRT TI - Semantic Consistency Policy Optimization for Reinforcement Learning of LLM Agents AU - Peng Xu AU - Sijia Chen AU - Junzhuo Li AU - Xuming Hu PY - 2026 UR - https://arxiv.org/abs/2606.25852 ID - 2606.25852 ER -