@misc{indiciaeafa2f8aea763, title = {AVESFormer: Efficient Transformer Design for Real-Time Audio-Visual Segmentation}, author = {Zili Wang and Qi Yang and Linsu Shi and Jiazhong Yu and Qinghua Liang and Fei Li and Shiming Xiang}, year = {2024}, url = {https://arxiv.org/abs/2408.01708}, note = {Source identifier: 2408.01708} }