{"task":"Visual Question Answering (VQA)","dataset":"AI2D","metric_names":["EM"],"rows":[{"id":25471,"task":"Visual Question Answering (VQA)","parent_task":null,"dataset":"AI2D","model_name":"SMoLA-PaLI-X Specialist Model","metrics":{"EM":"82.5"},"paper_url":"https://arxiv.org/abs/2312.00968v2","paper_title":"Omni-SMoLA: Boosting Generalist Multimodal Models with Soft Mixture of Low-rank Experts","paper_date":"2023-12-01","code_links":[],"metrics_order":"[\"EM\"]","area":"Natural Language Processing","uses_additional_data":1,"source":"archive","tags":[]},{"id":25472,"task":"Visual Question Answering (VQA)","parent_task":null,"dataset":"AI2D","model_name":"SMoLA-PaLI-X Generalist Model","metrics":{"EM":"81.4"},"paper_url":"https://arxiv.org/abs/2312.00968v2","paper_title":"Omni-SMoLA: Boosting Generalist Multimodal Models with Soft Mixture of Low-rank Experts","paper_date":"2023-12-01","code_links":[],"metrics_order":"[\"EM\"]","area":"Natural Language Processing","uses_additional_data":1,"source":"archive","tags":[]},{"id":25473,"task":"Visual Question Answering (VQA)","parent_task":null,"dataset":"AI2D","model_name":"Gemini Ultra","metrics":{"EM":"79.5"},"paper_url":"https://arxiv.org/abs/2312.11805v5","paper_title":"Gemini: A Family of Highly Capable Multimodal Models","paper_date":"2023-12-19","code_links":[{"title":"valdecy/pybibx","url":"https://github.com/valdecy/pybibx"}],"metrics_order":"[\"EM\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":25474,"task":"Visual Question Answering (VQA)","parent_task":null,"dataset":"AI2D","model_name":"DUBLIN","metrics":{"EM":"51.11"},"paper_url":"https://arxiv.org/abs/2305.14218v4","paper_title":"DUBLIN -- Document Understanding By Language-Image Network","paper_date":"2023-05-23","code_links":[],"metrics_order":"[\"EM\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]}]}