@misc{indiciae1994e8260a17, title = {When LLaVA Meets Objects: Token Composition for Vision-Language-Models}, author = {Soumya Jahagirdar and Walid Bousselham and Anna Kukleva and Hilde Kuehne}, year = {2026}, url = {https://arxiv.org/abs/2602.04864}, note = {Source identifier: 2602.04864} }