TY - RPRT TI - FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion AU - Shunian Chen AU - Xinyuan Xie AU - Zheshu Chen AU - Liyan Zhao AU - Owen Lee AU - Zhan Su AU - Qilin Sun AU - Benyou Wang PY - 2025 UR - https://arxiv.org/abs/2506.01111 ID - 2506.01111 ER -