{"task":"Zero-Shot Learning","dataset":"TVQA","metric_names":["Accuracy"],"rows":[{"id":21725,"task":"Zero-Shot Learning","parent_task":null,"dataset":"TVQA","model_name":"VideoChat2","metrics":{"Accuracy":"40.6"},"paper_url":"https://arxiv.org/abs/2311.17005v4","paper_title":"MVBench: A Comprehensive Multi-modal Video Understanding Benchmark","paper_date":"2023-11-28","code_links":[{"title":"opengvlab/ask-anything","url":"https://github.com/opengvlab/ask-anything"},{"title":"magic-research/PLLaVA","url":"https://github.com/magic-research/PLLaVA"},{"title":"bytedance/tarsier","url":"https://github.com/bytedance/tarsier"}],"metrics_order":"[\"Accuracy\"]","area":"Methodology","uses_additional_data":0,"source":"archive","tags":[]}]}