@misc{indiciae3ab8a055e4a6, title = {Composition Vision-Language Understanding via Segment and Depth Anything Model}, author = {Mingxiao Huo and Pengliang Ji and Haotian Lin and Junchen Liu and Yixiao Wang and Yijun Chen}, year = {2024}, url = {https://arxiv.org/abs/2406.18591}, note = {Source identifier: 2406.18591} }