@misc{indiciaed52d44b76839, title = {Referring Segmentation in Images and Videos with Cross-Modal Self-Attention Network}, author = {Linwei Ye and Mrigank Rochan and Zhi Liu and Xiaoqin Zhang and Yang Wang}, year = {2021}, doi = {10.1109/tpami.2021.3054384}, url = {https://arxiv.org/abs/2102.04762}, note = {Source identifier: 2102.04762} }