TY - RPRT TI - Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos AU - Yuchi Ishikawa AU - Shota Nakada AU - Hokuto Munakata AU - Kazuhiro Saito AU - Tatsuya Komatsu AU - Yoshimitsu Aoki PY - 2025 UR - https://arxiv.org/abs/2507.11967 ID - 2507.11967 ER -