@article{vlmtvisionlanguagemultimodaltransformer, title = {VLMT: Vision-Language Multimodal Transformer for Multimodal Multi-hop Question Answering}, author = {Qi Zhi Lim and Chin Poo Lee and Kian Ming Lim and Kalaiarasi Sonai Muthu Anbananthen}, year = {2025}, eprint = {2504.08269}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2504.08269v1}, }