{"task":"Temporal/Casual QA","dataset":"NExT-QA","metric_names":["WUPS"],"rows":[{"id":25429,"task":"Temporal/Casual QA","parent_task":"Question Answering","dataset":"NExT-QA","model_name":"PaLI-X","metrics":{"WUPS":"38.3"},"paper_url":"https://arxiv.org/abs/2305.18565v1","paper_title":"PaLI-X: On Scaling up a Multilingual Vision and Language Model","paper_date":"2023-05-29","code_links":[{"title":"kyegomez/PALI","url":"https://github.com/kyegomez/PALI"},{"title":"doc-doc/NExT-OE","url":"https://github.com/doc-doc/NExT-OE"}],"metrics_order":"[\"WUPS\"]","area":"Natural Language Processing","uses_additional_data":1,"source":"archive","tags":[]},{"id":25430,"task":"Temporal/Casual QA","parent_task":"Question Answering","dataset":"NExT-QA","model_name":"PaLI-3","metrics":{"WUPS":"37.7"},"paper_url":"https://arxiv.org/abs/2310.09199v2","paper_title":"PaLI-3 Vision Language Models: Smaller, Faster, Stronger","paper_date":"2023-10-13","code_links":[{"title":"kyegomez/PALI3","url":"https://github.com/kyegomez/PALI3"}],"metrics_order":"[\"WUPS\"]","area":"Natural Language Processing","uses_additional_data":1,"source":"archive","tags":[]},{"id":25431,"task":"Temporal/Casual QA","parent_task":"Question Answering","dataset":"NExT-QA","model_name":"R2A","metrics":{"WUPS":"34.7"},"paper_url":"https://arxiv.org/abs/2306.11732v1","paper_title":"Retrieving-to-Answer: Zero-Shot Video Question Answering with Frozen Large Language Models","paper_date":"2023-06-15","code_links":[],"metrics_order":"[\"WUPS\"]","area":"Natural Language Processing","uses_additional_data":1,"source":"archive","tags":[]},{"id":25432,"task":"Temporal/Casual QA","parent_task":"Question Answering","dataset":"NExT-QA","model_name":"Flamingo(32-shot)","metrics":{"WUPS":"33.5"},"paper_url":"https://arxiv.org/abs/2204.14198v2","paper_title":"Flamingo: a Visual Language Model for Few-Shot Learning","paper_date":"2022-04-29","code_links":[{"title":"mlfoundations/open_flamingo","url":"https://github.com/mlfoundations/open_flamingo"},{"title":"lucidrains/flamingo-pytorch","url":"https://github.com/lucidrains/flamingo-pytorch"},{"title":"unispac/visual-adversarial-examples-jailbreak-large-language-models","url":"https://github.com/unispac/visual-adversarial-examples-jailbreak-large-language-models"},{"title":"doc-doc/NExT-OE","url":"https://github.com/doc-doc/NExT-OE"},{"title":"happen2me/cross-gnn","url":"https://github.com/happen2me/cross-gnn"}],"metrics_order":"[\"WUPS\"]","area":"Natural Language Processing","uses_additional_data":1,"source":"archive","tags":[]},{"id":25433,"task":"Temporal/Casual QA","parent_task":"Question Answering","dataset":"NExT-QA","model_name":"Gemini Ultra (zero-shot)","metrics":{"WUPS":"29.9"},"paper_url":"https://arxiv.org/abs/2312.11805v5","paper_title":"Gemini: A Family of Highly Capable Multimodal Models","paper_date":"2023-12-19","code_links":[{"title":"valdecy/pybibx","url":"https://github.com/valdecy/pybibx"}],"metrics_order":"[\"WUPS\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":25434,"task":"Temporal/Casual QA","parent_task":"Question Answering","dataset":"NExT-QA","model_name":"Gemini Pro (zero-shot)","metrics":{"WUPS":"28.0"},"paper_url":"https://arxiv.org/abs/2312.11805v5","paper_title":"Gemini: A Family of Highly Capable Multimodal Models","paper_date":"2023-12-19","code_links":[{"title":"valdecy/pybibx","url":"https://github.com/valdecy/pybibx"}],"metrics_order":"[\"WUPS\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":25435,"task":"Temporal/Casual QA","parent_task":"Question Answering","dataset":"NExT-QA","model_name":"Flamingo(0-shot)","metrics":{"WUPS":"26.7"},"paper_url":"https://arxiv.org/abs/2204.14198v2","paper_title":"Flamingo: a Visual Language Model for Few-Shot Learning","paper_date":"2022-04-29","code_links":[{"title":"mlfoundations/open_flamingo","url":"https://github.com/mlfoundations/open_flamingo"},{"title":"lucidrains/flamingo-pytorch","url":"https://github.com/lucidrains/flamingo-pytorch"},{"title":"unispac/visual-adversarial-examples-jailbreak-large-language-models","url":"https://github.com/unispac/visual-adversarial-examples-jailbreak-large-language-models"},{"title":"doc-doc/NExT-OE","url":"https://github.com/doc-doc/NExT-OE"},{"title":"happen2me/cross-gnn","url":"https://github.com/happen2me/cross-gnn"}],"metrics_order":"[\"WUPS\"]","area":"Natural Language Processing","uses_additional_data":1,"source":"archive","tags":[]},{"id":25436,"task":"Temporal/Casual QA","parent_task":"Question Answering","dataset":"NExT-QA","model_name":"Emu(0-shot)","metrics":{"WUPS":"23.4"},"paper_url":"https://arxiv.org/abs/2307.05222v2","paper_title":"Emu: Generative Pretraining in Multimodality","paper_date":"2023-07-11","code_links":[{"title":"baaivision/emu","url":"https://github.com/baaivision/emu"},{"title":"doc-doc/NExT-OE","url":"https://github.com/doc-doc/NExT-OE"}],"metrics_order":"[\"WUPS\"]","area":"Natural Language Processing","uses_additional_data":1,"source":"archive","tags":[]}]}