TY - RPRT TI - Evaluating Language Models' Evaluations of Games AU - Katherine M. Collins AU - Cedegao E. Zhang AU - Graham Todd AU - Lance Ying AU - Mauricio Barba da Costa AU - Ryan Liu AU - Prafull Sharma AU - Adrian Weller AU - Ionatan Kuperwajs AU - Lionel Wong AU - Joshua B. Tenenbaum AU - Thomas L. Griffiths PY - 2026 UR - https://arxiv.org/abs/2510.10930 ID - 2510.10930 ER -