@misc{indiciae7973aa76bade, title = {SLAP: Scalable Language-Audio Pretraining with Variable-Duration Audio and Multi-Objective Training}, author = {Xinhao Mei and Gael Le Lan and Haohe Liu and Zhaoheng Ni and Varun Nagaraja and Yang Liu and Yangyang Shi and Vikas Chandra}, year = {2026}, url = {https://arxiv.org/abs/2601.12594}, note = {Source identifier: 2601.12594} }