@article{visionlanguagemodelbasedcaption, title = {Vision Language Model-based Caption Evaluation Method Leveraging Visual Context Extraction}, author = {Koki Maeda and Shuhei Kurita and Taiki Miyanishi and Naoaki Okazaki}, year = {2024}, eprint = {2402.17969}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2402.17969v1}, }