TY - RPRT TI - Aligning Medical Conversational AI through Online Reinforcement Learning with Information-Theoretic Rewards AU - Tanvi Verma AU - Yang Zhou AU - Rick Siow Mong Goh AU - Yong Liu PY - 2026 UR - https://arxiv.org/abs/2601.17828 ID - 2601.17828 ER -