@misc{indiciae3f8446f6d099, title = {Multi-Stage Multi-Modal Pre-Training for Automatic Speech Recognition}, author = {Yash Jain and David Chan and Pranav Dheram and Aparna Khare and Olabanji Shonibare and Venkatesh Ravichandran and Shalini Ghosh}, year = {2024}, url = {https://arxiv.org/abs/2403.19822}, note = {Source identifier: 2403.19822} }