TY - RPRT TI - Parallel Tempering Initial Sampling in Inference-Time Reward Alignment AU - Myeongjun Oh AU - Gwangho Kim AU - Sungyoon Lee PY - 2026 UR - https://arxiv.org/abs/2605.30991 ID - 2605.30991 ER -