@misc{indiciaec65088e9b5a0, title = {OTTER: Open-Tagging via Text-Image Representation for Multi-modal Understanding}, author = {Jieer Ouyang and Xiaoneng Xiang and Zheng Wang and Yangkai Ding}, year = {2025}, url = {https://arxiv.org/abs/2510.00652}, note = {Source identifier: 2510.00652} }