TY - RPRT TI - Small LLMs Do Not Learn a Generalizable Theory of Mind via Reinforcement Learning AU - Sneheel Sarangi AU - Hanan Salam PY - 2025 UR - https://arxiv.org/abs/2507.15788 ID - 2507.15788 ER -