TY - RPRT TI - Composition Vision-Language Understanding via Segment and Depth Anything Model AU - Mingxiao Huo AU - Pengliang Ji AU - Haotian Lin AU - Junchen Liu AU - Yixiao Wang AU - Yijun Chen PY - 2024 UR - https://arxiv.org/abs/2406.18591 ID - 2406.18591 ER -