TY - RPRT TI - Evaluating Interactive Reasoning in Large Language Models: A Hierarchical Benchmark with Executable Games AU - Mingyuan Fan AU - Weiguang Han AU - Daixin Wang AU - Cen Chen AU - Zhiqiang Zhang AU - Jun Zhou PY - 2026 UR - https://arxiv.org/abs/2606.00103 ID - 2606.00103 ER -