@misc{indiciae2cb81be424ec, title = {EAR: Enhancing Uni-Modal Representations for Weakly Supervised Audio-Visual Video Parsing}, author = {Huilai Li and Xiaomeng Di and Ying Xing and Yonghao Dang and Yiming Wang and Jianqin Yin}, year = {2026}, url = {https://arxiv.org/abs/2605.08723}, note = {Source identifier: 2605.08723} }