@misc{indiciaecdaa2b7a9e7d, title = {Improving Audio-Visual Speech Recognition by Lip-Subword Correlation Based Visual Pre-training and Cross-Modal Fusion Encoder}, author = {Yusheng Dai and Hang Chen and Jun Du and Xiaofei Ding and Ning Ding and Feijun Jiang and Chin-Hui Lee}, year = {2024}, url = {https://arxiv.org/abs/2308.08488}, note = {Source identifier: 2308.08488} }