@misc{indiciae189d4e96133c, title = {LongLLaVA: Scaling Multi-modal LLMs to 1000 Images Efficiently via a Hybrid Architecture}, author = {Xidong Wang and Dingjie Song and Shunian Chen and Junyin Chen and Zhenyang Cai and Chen Zhang and Lichao Sun and Benyou Wang}, year = {2025}, url = {https://arxiv.org/abs/2409.02889}, note = {Source identifier: 2409.02889} }