@article{morethanthefinalanswerimprovingvisualext, title = {More Than the Final Answer: Improving Visual Extraction and Logical Consistency in Vision-Language Models}, author = {Hoang Anh Just and Yifei Fan and Handong Zhao and Jiuxiang Gu and Ruiyi Zhang and Simon Jenni and Kushal Kafle and Ruoxi Jia and Jing Shi}, year = {2025}, eprint = {2512.12487}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2512.12487}, }