TY - RPRT TI - ThinkTwice: Jointly Optimizing Large Language Models for Reasoning and Self-Refinement AU - Difan Jiao AU - Qianfeng Wen AU - Blair Yang AU - Zhenwei Tang AU - Ashton Anderson PY - 2026 UR - https://arxiv.org/abs/2604.01591 ID - 2604.01591 ER -