@misc{indiciaeb5cdf6b7fe2a, title = {STOA-VLP: Spatial-Temporal Modeling of Object and Action for Video-Language Pre-training}, author = {Weihong Zhong and Mao Zheng and Duyu Tang and Xuan Luo and Heng Gong and Xiaocheng Feng and Bing Qin}, year = {2023}, doi = {10.1609/aaai.v37i3.25483}, url = {https://arxiv.org/abs/2302.09736}, note = {Source identifier: 2302.09736} }