@article{vlrmvisionlanguagemodelsactasreward, title = {VLRM: Vision-Language Models act as Reward Models for Image Captioning}, author = {Maksim Dzabraev and Alexander Kunitsyn and Andrei Ivaniuta}, year = {2024}, eprint = {2404.01911}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2404.01911v1}, }