@misc{indiciae0834310dc215, title = {Multimodal Alignment with Cross-Attentive GRUs for Fine-Grained Video Understanding}, author = {Namho Kim and Junhwa Kim}, year = {2025}, url = {https://arxiv.org/abs/2507.03531}, note = {Source identifier: 2507.03531} }