TY - RPRT TI - AVCap: Leveraging Audio-Visual Features as Text Tokens for Captioning AU - Jongsuk Kim AU - Jiwon Shin AU - Junmo Kim PY - 2024 UR - https://arxiv.org/abs/2407.07801 ID - 2407.07801 ER -