TY - RPRT TI - Learning to Reason in LLMs by Expectation Maximization AU - Junghyun Lee AU - Branislav Kveton AU - Anup Rao AU - Subhojyoti Mukherjee AU - Ryan A. Rossi AU - Sunav Choudhary AU - Alexa Siu PY - 2026 UR - https://arxiv.org/abs/2512.20169 ID - 2512.20169 ER -