@misc{indiciae2399f6480fe3, title = {Hourglass-AVSR: Down-Up Sampling-based Computational Efficiency Model for Audio-Visual Speech Recognition}, author = {Fan Yu and Haoxu Wang and Ziyang Ma and Shiliang Zhang}, year = {2023}, url = {https://arxiv.org/abs/2312.08850}, note = {Source identifier: 2312.08850} }