@misc{indiciaecfc9f772e4dc, title = {Optimizing Vision-Language Consistency via Cross-Layer Regional Attention Alignment}, author = {Yifan Wang and Hongfeng Ai and Quangao Liu and Maowei Jiang and Ruiyuan Kang and Ruiqi Li and Jiahua Dong and Mengting Xiao and Cheng Jiang and Chenzhong Li}, year = {2025}, url = {https://arxiv.org/abs/2508.00945}, note = {Source identifier: 2508.00945} }