@misc{indiciae04d23ccc8d24, title = {MSRS: Training Multimodal Speech Recognition Models from Scratch with Sparse Mask Optimization}, author = {Adriana Fernandez-Lopez and Honglie Chen and Pingchuan Ma and Lu Yin and Qiao Xiao and Stavros Petridis and Shiwei Liu and Maja Pantic}, year = {2024}, url = {https://arxiv.org/abs/2406.17614}, note = {Source identifier: 2406.17614} }