@misc{indiciaed99748519d60, title = {Dense Audio-Visual Event Localization under Cross-Modal Consistency and Multi-Temporal Granularity Collaboration}, author = {Ziheng Zhou and Jinxing Zhou and Wei Qian and Shengeng Tang and Xiaojun Chang and Dan Guo}, year = {2024}, url = {https://arxiv.org/abs/2412.12628}, note = {Source identifier: 2412.12628} }