@misc{indiciaea179c6a949fb, title = {Evaluating Interactive Reasoning in Large Language Models: A Hierarchical Benchmark with Executable Games}, author = {Mingyuan Fan and Weiguang Han and Daixin Wang and Cen Chen and Zhiqiang Zhang and Jun Zhou}, year = {2026}, url = {https://arxiv.org/abs/2606.00103}, note = {Source identifier: 2606.00103} }