@misc{indiciaec27e5991bd9d, title = {CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment}, author = {Edson Araujo and Andrew Rouditchenko and Yuan Gong and Saurabhchand Bhati and Samuel Thomas and Brian Kingsbury and Leonid Karlinsky and Rogerio Feris and James R. Glass and Hilde Kuehne}, year = {2025}, url = {https://arxiv.org/abs/2505.01237}, note = {Source identifier: 2505.01237} }