@misc{indiciae363293b627c0, title = {Augmenting Large Audio-Language Models with Frame-Level Grounding for Fine-Grained Temporal Perception}, author = {Yanfeng Shi and Yan Song and Junhui Li and Tinggan Huang and Wu Guo and Haoyu Song and Ian McLoughlin}, year = {2026}, url = {https://arxiv.org/abs/2609.15215}, note = {Source identifier: 2609.15215} }