@misc{indiciae368091d74f5c, title = {VQ-CTAP: Cross-Modal Fine-Grained Sequence Representation Learning for Speech Processing}, author = {Chunyu Qiang and Wang Geng and Yi Zhao and Ruibo Fu and Tao Wang and Cheng Gong and Tianrui Wang and Qiuyu Liu and Jiangyan Yi and Zhengqi Wen and Chen Zhang and Hao Che and Longbiao Wang and Jianwu Dang and Jianhua Tao}, year = {2025}, url = {https://arxiv.org/abs/2408.05758}, note = {Source identifier: 2408.05758} }