@misc{indiciae5782101f5fd1, title = {AVCap: Leveraging Audio-Visual Features as Text Tokens for Captioning}, author = {Jongsuk Kim and Jiwon Shin and Junmo Kim}, year = {2024}, url = {https://arxiv.org/abs/2407.07801}, note = {Source identifier: 2407.07801} }