@misc{indiciae58d8c05dd302, title = {Diff-MM: Exploring Pre-trained Text-to-Image Generation Model for Unified Multi-modal Object Tracking}, author = {Shiyu Xuan and Zechao Li and Jinhui Tang}, year = {2025}, url = {https://arxiv.org/abs/2505.12606}, note = {Source identifier: 2505.12606} }