@misc{indiciae8c61ede2123f, title = {Can VLMs be used on videos for action recognition? LLMs are Visual Reasoning Coordinators}, author = {Harsh Lunia}, year = {2024}, url = {https://arxiv.org/abs/2407.14834}, note = {Source identifier: 2407.14834} }