@article{letsthinkframebyframeevaluatingvideo, title = {Let's Think Frame by Frame with VIP: A Video Infilling and Prediction Dataset for Evaluating Video Chain-of-Thought}, author = {Vaishnavi Himakunthala and Andy Ouyang and Daniel Rose and Ryan He and Alex Mei and Yujie Lu and Chinmay Sonar and Michael Saxon and William Yang Wang}, year = {2023}, eprint = {2305.13903}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2305.13903v3}, }