@misc{indiciae4514a2caa800, title = {Linguistically Informed Multimodal Fusion for Vietnamese Scene-Text Image Captioning: Dataset, Graph Framework, and Phonological Attention}, author = {Nhi Ngoc-Yen Nguyen and Anh-Duc Nguyen and Nghia Hieu Nguyen and Kiet Van Nguyen and Ngan Luu-Thuy Nguyen}, year = {2026}, url = {https://arxiv.org/abs/2604.27712}, note = {Source identifier: 2604.27712} }