@misc{indiciaedf884f1b9176, title = {Meta-Personalizing Vision-Language Models to Find Named Instances in Video}, author = {Chun-Hsiao Yeh and Bryan Russell and Josef Sivic and Fabian Caba Heilbron and Simon Jenni}, year = {2023}, url = {https://arxiv.org/abs/2306.10169}, note = {Source identifier: 2306.10169} }