@misc{indiciae355fa598653e, title = {MixSpeech: Cross-Modality Self-Learning with Audio-Visual Stream Mixup for Visual Speech Translation and Recognition}, author = {Xize Cheng and Linjun Li and Tao Jin and Rongjie Huang and Wang Lin and Zehan Wang and Huangdai Liu and Ye Wang and Aoxiong Yin and Zhou Zhao}, year = {2023}, url = {https://arxiv.org/abs/2303.05309}, note = {Source identifier: 2303.05309} }