@misc{indiciaeb918f5684dee, title = {Benchmarking Sequential Visual Input Reasoning and Prediction in Multimodal Large Language Models}, author = {Mingwei Zhu and Leigang Sha and Yu Shu and Kangjia Zhao and Tiancheng Zhao and Jianwei Yin}, year = {2023}, url = {https://arxiv.org/abs/2310.13473}, note = {Source identifier: 2310.13473} }