@misc{indiciae786e68677ba2, title = {DTFSal: Audio-Visual Dynamic Token Fusion for Video Saliency Prediction}, author = {Kiana Hooshanfar and Alireza Hosseini and Ahmad Kalhor and Babak Nadjar Araabi}, year = {2025}, url = {https://arxiv.org/abs/2504.10070}, note = {Source identifier: 2504.10070} }