@misc{indiciaeb4404dae594a, title = {ABMAMBA: Multimodal Large Language Model with Aligned Hierarchical Bidirectional Scan for Efficient Video Captioning}, author = {Daichi Yashima and Shuhei Kurita and Yusuke Oda and Shuntaro Suzuki and Seitaro Otsuki and Komei Sugiura}, year = {2026}, url = {https://arxiv.org/abs/2604.08050}, note = {Source identifier: 2604.08050} }