@article{optimizingvisionlanguageconsistencyviacr, title = {Optimizing Vision-Language Consistency via Cross-Layer Regional Attention Alignment}, author = {Yifan Wang and Hongfeng Ai and Quangao Liu and Maowei Jiang and Ruiyuan Kang and Ruiqi Li and Jiahua Dong and Mengting Xiao and Cheng Jiang and Chenzhong Li}, year = {2025}, eprint = {2508.00945}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2508.00945}, }