TY - RPRT TI - Linguistically Informed Multimodal Fusion for Vietnamese Scene-Text Image Captioning: Dataset, Graph Framework, and Phonological Attention AU - Nhi Ngoc-Yen Nguyen AU - Anh-Duc Nguyen AU - Nghia Hieu Nguyen AU - Kiet Van Nguyen AU - Ngan Luu-Thuy Nguyen PY - 2026 UR - https://arxiv.org/abs/2604.27712 ID - 2604.27712 ER -