TY - RPRT TI - Vision Language Model-based Caption Evaluation Method Leveraging Visual Context Extraction AU - Koki Maeda AU - Shuhei Kurita AU - Taiki Miyanishi AU - Naoaki Okazaki PY - 2024 UR - https://arxiv.org/abs/2402.17969 ID - 2402.17969 ER -