TY - RPRT TI - ETTRL: Balancing Exploration and Exploitation in LLM Test-Time Reinforcement Learning Via Entropy Mechanism AU - Jia Liu AU - ChangYi He AU - YingQiao Lin AU - MingMin Yang AU - FeiYang Shen AU - ShaoGuo Liu PY - 2025 UR - https://arxiv.org/abs/2508.11356 ID - 2508.11356 ER -