@misc{indiciaef295b70e9581, title = {Learning CLIP Guided Visual-Text Fusion Transformer for Video-based Pedestrian Attribute Recognition}, author = {Jun Zhu and Jiandong Jin and Zihan Yang and Xiaohao Wu and Xiao Wang}, year = {2023}, url = {https://arxiv.org/abs/2304.10091}, note = {Source identifier: 2304.10091} }