@article{overcomingvisionlanguagemodelchallenges, title = {Overcoming Vision Language Model Challenges in Diagram Understanding: A Proof-of-Concept with XML-Driven Large Language Models Solutions}, author = {Shue Shiinoki and Ryo Koshihara and Hayato Motegi and Masumi Morishige}, year = {2025}, eprint = {2502.04389}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2502.04389v1}, }