@misc{indiciae12cbcdfa60dc, title = {STVGFormer: Spatio-Temporal Video Grounding with Static-Dynamic Cross-Modal Understanding}, author = {Zihang Lin and Chaolei Tan and Jian-Fang Hu and Zhi Jin and Tiancai Ye and Wei-Shi Zheng}, year = {2022}, url = {https://arxiv.org/abs/2207.02756}, note = {Source identifier: 2207.02756} }