@misc{indiciae219ece5d6af0, title = {MED-VT++: Unifying Multimodal Learning with a Multiscale Encoder-Decoder Video Transformer}, author = {Rezaul Karim and He Zhao and Richard P. Wildes and Mennatullah Siam}, year = {2024}, url = {https://arxiv.org/abs/2304.05930}, note = {Source identifier: 2304.05930} }