{"task":"image-sentence alignment","dataset":"VALSE coreference clean","metric_names":["pairwise accuracy","Accuracy (%)"],"rows":[{"id":107553,"task":"image-sentence alignment","parent_task":"Multimodal Text and Image Classification","dataset":"VALSE coreference clean","model_name":"ViLBERT 12-in-1","metrics":{"Accuracy (%)":"54.3","pairwise accuracy":"69.2"},"paper_url":"https://arxiv.org/abs/2112.07566v2","paper_title":"VALSE: A Task-Independent Benchmark for Vision and Language Models Centered on Linguistic Phenomena","paper_date":"2021-12-14","code_links":[{"title":"heidelberg-nlp/valse","url":"https://github.com/heidelberg-nlp/valse"}],"metrics_order":"[\"pairwise accuracy\", \"Accuracy (%)\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":107554,"task":"image-sentence alignment","parent_task":"Multimodal Text and Image Classification","dataset":"VALSE coreference clean","model_name":"GPT2","metrics":{"pairwise accuracy":"50.0"},"paper_url":"https://arxiv.org/abs/2112.07566v2","paper_title":"VALSE: A Task-Independent Benchmark for Vision and Language Models Centered on Linguistic Phenomena","paper_date":"2021-12-14","code_links":[{"title":"heidelberg-nlp/valse","url":"https://github.com/heidelberg-nlp/valse"}],"metrics_order":"[\"pairwise accuracy\", \"Accuracy (%)\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":107555,"task":"image-sentence alignment","parent_task":"Multimodal Text and Image Classification","dataset":"VALSE coreference clean","model_name":"CLIP","metrics":{"pairwise accuracy":"49.7"},"paper_url":"https://arxiv.org/abs/2112.07566v2","paper_title":"VALSE: A Task-Independent Benchmark for Vision and Language Models Centered on Linguistic Phenomena","paper_date":"2021-12-14","code_links":[{"title":"heidelberg-nlp/valse","url":"https://github.com/heidelberg-nlp/valse"}],"metrics_order":"[\"pairwise accuracy\", \"Accuracy (%)\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":107556,"task":"image-sentence alignment","parent_task":"Multimodal Text and Image Classification","dataset":"VALSE coreference clean","model_name":"ViLBERT","metrics":{"Accuracy (%)":"50.0","pairwise accuracy":"48.1"},"paper_url":"https://arxiv.org/abs/2112.07566v2","paper_title":"VALSE: A Task-Independent Benchmark for Vision and Language Models Centered on Linguistic Phenomena","paper_date":"2021-12-14","code_links":[{"title":"heidelberg-nlp/valse","url":"https://github.com/heidelberg-nlp/valse"}],"metrics_order":"[\"pairwise accuracy\", \"Accuracy (%)\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":107557,"task":"image-sentence alignment","parent_task":"Multimodal Text and Image Classification","dataset":"VALSE coreference clean","model_name":"VisualBERT","metrics":{"Accuracy (%)":"50.0","pairwise accuracy":"47.6"},"paper_url":"https://arxiv.org/abs/2112.07566v2","paper_title":"VALSE: A Task-Independent Benchmark for Vision and Language Models Centered on Linguistic Phenomena","paper_date":"2021-12-14","code_links":[{"title":"heidelberg-nlp/valse","url":"https://github.com/heidelberg-nlp/valse"}],"metrics_order":"[\"pairwise accuracy\", \"Accuracy (%)\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":107558,"task":"image-sentence alignment","parent_task":"Multimodal Text and Image Classification","dataset":"VALSE coreference clean","model_name":"GPT1","metrics":{"pairwise accuracy":"45.2"},"paper_url":"https://arxiv.org/abs/2112.07566v2","paper_title":"VALSE: A Task-Independent Benchmark for Vision and Language Models Centered on Linguistic Phenomena","paper_date":"2021-12-14","code_links":[{"title":"heidelberg-nlp/valse","url":"https://github.com/heidelberg-nlp/valse"}],"metrics_order":"[\"pairwise accuracy\", \"Accuracy (%)\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":107559,"task":"image-sentence alignment","parent_task":"Multimodal Text and Image Classification","dataset":"VALSE coreference clean","model_name":"LXMERT","metrics":{"Accuracy (%)":"49.0","pairwise accuracy":"44.2"},"paper_url":"https://arxiv.org/abs/2112.07566v2","paper_title":"VALSE: A Task-Independent Benchmark for Vision and Language Models Centered on Linguistic Phenomena","paper_date":"2021-12-14","code_links":[{"title":"heidelberg-nlp/valse","url":"https://github.com/heidelberg-nlp/valse"}],"metrics_order":"[\"pairwise accuracy\", \"Accuracy (%)\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":129477,"task":"image-sentence alignment","parent_task":"Multimodal Text and Image Classification","dataset":"VALSE coreference clean","model_name":"ViLBERT 12-in-1","metrics":{"Accuracy (%)":"54.3","pairwise accuracy":"69.2"},"paper_url":"https://arxiv.org/abs/2112.07566v2","paper_title":"VALSE: A Task-Independent Benchmark for Vision and Language Models Centered on Linguistic Phenomena","paper_date":"2021-12-14","code_links":[{"title":"heidelberg-nlp/valse","url":"https://github.com/heidelberg-nlp/valse"}],"metrics_order":"[\"pairwise accuracy\", \"Accuracy (%)\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":129478,"task":"image-sentence alignment","parent_task":"Multimodal Text and Image Classification","dataset":"VALSE coreference clean","model_name":"GPT2","metrics":{"pairwise accuracy":"50.0"},"paper_url":"https://arxiv.org/abs/2112.07566v2","paper_title":"VALSE: A Task-Independent Benchmark for Vision and Language Models Centered on Linguistic Phenomena","paper_date":"2021-12-14","code_links":[{"title":"heidelberg-nlp/valse","url":"https://github.com/heidelberg-nlp/valse"}],"metrics_order":"[\"pairwise accuracy\", \"Accuracy (%)\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":129479,"task":"image-sentence alignment","parent_task":"Multimodal Text and Image Classification","dataset":"VALSE coreference clean","model_name":"CLIP","metrics":{"pairwise accuracy":"49.7"},"paper_url":"https://arxiv.org/abs/2112.07566v2","paper_title":"VALSE: A Task-Independent Benchmark for Vision and Language Models Centered on Linguistic Phenomena","paper_date":"2021-12-14","code_links":[{"title":"heidelberg-nlp/valse","url":"https://github.com/heidelberg-nlp/valse"}],"metrics_order":"[\"pairwise accuracy\", \"Accuracy (%)\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":129480,"task":"image-sentence alignment","parent_task":"Multimodal Text and Image Classification","dataset":"VALSE coreference clean","model_name":"ViLBERT","metrics":{"Accuracy (%)":"50.0","pairwise accuracy":"48.1"},"paper_url":"https://arxiv.org/abs/2112.07566v2","paper_title":"VALSE: A Task-Independent Benchmark for Vision and Language Models Centered on Linguistic Phenomena","paper_date":"2021-12-14","code_links":[{"title":"heidelberg-nlp/valse","url":"https://github.com/heidelberg-nlp/valse"}],"metrics_order":"[\"pairwise accuracy\", \"Accuracy (%)\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":129481,"task":"image-sentence alignment","parent_task":"Multimodal Text and Image Classification","dataset":"VALSE coreference clean","model_name":"VisualBERT","metrics":{"Accuracy (%)":"50.0","pairwise accuracy":"47.6"},"paper_url":"https://arxiv.org/abs/2112.07566v2","paper_title":"VALSE: A Task-Independent Benchmark for Vision and Language Models Centered on Linguistic Phenomena","paper_date":"2021-12-14","code_links":[{"title":"heidelberg-nlp/valse","url":"https://github.com/heidelberg-nlp/valse"}],"metrics_order":"[\"pairwise accuracy\", \"Accuracy (%)\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":129482,"task":"image-sentence alignment","parent_task":"Multimodal Text and Image Classification","dataset":"VALSE coreference clean","model_name":"GPT1","metrics":{"pairwise accuracy":"45.2"},"paper_url":"https://arxiv.org/abs/2112.07566v2","paper_title":"VALSE: A Task-Independent Benchmark for Vision and Language Models Centered on Linguistic Phenomena","paper_date":"2021-12-14","code_links":[{"title":"heidelberg-nlp/valse","url":"https://github.com/heidelberg-nlp/valse"}],"metrics_order":"[\"pairwise accuracy\", \"Accuracy (%)\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":129483,"task":"image-sentence alignment","parent_task":"Multimodal Text and Image Classification","dataset":"VALSE coreference clean","model_name":"LXMERT","metrics":{"Accuracy (%)":"49.0","pairwise accuracy":"44.2"},"paper_url":"https://arxiv.org/abs/2112.07566v2","paper_title":"VALSE: A Task-Independent Benchmark for Vision and Language Models Centered on Linguistic Phenomena","paper_date":"2021-12-14","code_links":[{"title":"heidelberg-nlp/valse","url":"https://github.com/heidelberg-nlp/valse"}],"metrics_order":"[\"pairwise accuracy\", \"Accuracy (%)\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]}]}