@misc{indiciae424baca8f069, title = {FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion}, author = {Shunian Chen and Xinyuan Xie and Zheshu Chen and Liyan Zhao and Owen Lee and Zhan Su and Qilin Sun and Benyou Wang}, year = {2025}, url = {https://arxiv.org/abs/2506.01111}, note = {Source identifier: 2506.01111} }