TY - RPRT TI - CoRE: Consensus Rewards via Equilibrium for Test-Time Reinforcement Learning AU - Ambuj Mehrish AU - Sebastiano Vascon PY - 2026 UR - https://arxiv.org/abs/2608.09324 ID - 2608.09324 ER -