@misc{indiciae2f37a49b94d4, title = {End-to-end Open-vocabulary Video Visual Relationship Detection using Multi-modal Prompting}, author = {Yongqi Wang and Xinxiao Wu and Shuo Yang and Jiebo Luo}, year = {2025}, url = {https://arxiv.org/abs/2409.12499}, note = {Source identifier: 2409.12499} }