@article{beyondimagetextmatchingverbunderstanding, title = {Beyond Image-Text Matching: Verb Understanding in Multimodal Transformers Using Guided Masking}, author = {Ivana Beňová and Jana Košecká and Michal Gregor and Martin Tamajka and Marcel Veselý and Marián Šimko}, year = {2024}, eprint = {2401.16575}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2401.16575v1}, }