TY - RPRT TI - See What I Mean: Aligning Vision and Language Representations for Video Fine-grained Object Understanding AU - Boyuan Sun AU - Bowen Yin AU - Yuanming Li AU - Xihan Wei AU - Qibin Hou PY - 2026 UR - https://arxiv.org/abs/2605.18018 ID - 2605.18018 ER -