TY - RPRT TI - ABMAMBA: Multimodal Large Language Model with Aligned Hierarchical Bidirectional Scan for Efficient Video Captioning AU - Daichi Yashima AU - Shuhei Kurita AU - Yusuke Oda AU - Shuntaro Suzuki AU - Seitaro Otsuki AU - Komei Sugiura PY - 2026 UR - https://arxiv.org/abs/2604.08050 ID - 2604.08050 ER -