@article{vistadatasetdovisionlanguagemodels, title = {ViSTa Dataset: Do vision-language models understand sequential tasks?}, author = {Evžen Wybitul and Evan Ryan Gunter and Mikhail Seleznyov and David Lindner}, year = {2024}, eprint = {2411.13211}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2411.13211v2}, }