@misc{indiciaed3bd55aac54c, title = {"I See What You Did There": Can Large Vision-Language Models Understand Multimodal Puns?}, author = {Naen Xu and Jiayi Sheng and Changjiang Li and Chunyi Zhou and Yuyuan Li and Tianyu Du and Jun Wang and Zhihui Fu and Jinbao Li and Shouling Ji}, year = {2026}, url = {https://arxiv.org/abs/2604.05930}, note = {Source identifier: 2604.05930} }