TY - RPRT TI - Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking AU - Shiyu Xuan AU - Zechao Li AU - Jinhui Tang PY - 2025 UR - https://arxiv.org/abs/2505.12606 ID - 2505.12606 ER -