TY - RPRT TI - Improving Audio-Visual Speech Recognition by Lip-Subword Correlation Based Visual Pre-training and Cross-Modal Fusion Encoder AU - Yusheng Dai AU - Hang Chen AU - Jun Du AU - Xiaofei Ding AU - Ning Ding AU - Feijun Jiang AU - Chin-Hui Lee PY - 2024 UR - https://arxiv.org/abs/2308.08488 ID - 2308.08488 ER -