{"task":"image-sentence alignment","dataset":"VALSE foil-it (noun phrases)","metric_names":["pairwise accuracy","Accuracy (%)"],"rows":[{"id":107525,"task":"image-sentence alignment","parent_task":"Multimodal Text and Image Classification","dataset":"VALSE foil-it (noun phrases)","model_name":"CLIP","metrics":{"pairwise accuracy":"88.8"},"paper_url":"https://arxiv.org/abs/2112.07566v2","paper_title":"VALSE: A Task-Independent Benchmark for Vision and Language Models Centered on Linguistic Phenomena","paper_date":"2021-12-14","code_links":[{"title":"heidelberg-nlp/valse","url":"https://github.com/heidelberg-nlp/valse"}],"metrics_order":"[\"pairwise accuracy\", \"Accuracy (%)\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":107526,"task":"image-sentence alignment","parent_task":"Multimodal Text and Image Classification","dataset":"VALSE foil-it (noun phrases)","model_name":"LXMERT","metrics":{"Accuracy (%)":"70.8","pairwise accuracy":"87.1"},"paper_url":"https://arxiv.org/abs/2112.07566v2","paper_title":"VALSE: A Task-Independent Benchmark for Vision and Language Models Centered on Linguistic Phenomena","paper_date":"2021-12-14","code_links":[{"title":"heidelberg-nlp/valse","url":"https://github.com/heidelberg-nlp/valse"}],"metrics_order":"[\"pairwise accuracy\", \"Accuracy (%)\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":107527,"task":"image-sentence alignment","parent_task":"Multimodal Text and Image Classification","dataset":"VALSE foil-it (noun phrases)","model_name":"ViLBERT 12-in-1","metrics":{"Accuracy (%)":"71.5","pairwise accuracy":"86.9"},"paper_url":"https://arxiv.org/abs/2112.07566v2","paper_title":"VALSE: A Task-Independent Benchmark for Vision and Language Models Centered on Linguistic Phenomena","paper_date":"2021-12-14","code_links":[{"title":"heidelberg-nlp/valse","url":"https://github.com/heidelberg-nlp/valse"}],"metrics_order":"[\"pairwise accuracy\", \"Accuracy (%)\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":107528,"task":"image-sentence alignment","parent_task":"Multimodal Text and Image Classification","dataset":"VALSE foil-it (noun phrases)","model_name":"ViLBERT","metrics":{"Accuracy (%)":"55.9","pairwise accuracy":"86.9"},"paper_url":"https://arxiv.org/abs/2112.07566v2","paper_title":"VALSE: A Task-Independent Benchmark for Vision and Language Models Centered on Linguistic Phenomena","paper_date":"2021-12-14","code_links":[{"title":"heidelberg-nlp/valse","url":"https://github.com/heidelberg-nlp/valse"}],"metrics_order":"[\"pairwise accuracy\", \"Accuracy (%)\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":107529,"task":"image-sentence alignment","parent_task":"Multimodal Text and Image Classification","dataset":"VALSE foil-it (noun phrases)","model_name":"GPT2","metrics":{"pairwise accuracy":"80.7"},"paper_url":"https://arxiv.org/abs/2112.07566v2","paper_title":"VALSE: A Task-Independent Benchmark for Vision and Language Models Centered on Linguistic Phenomena","paper_date":"2021-12-14","code_links":[{"title":"heidelberg-nlp/valse","url":"https://github.com/heidelberg-nlp/valse"}],"metrics_order":"[\"pairwise accuracy\", \"Accuracy (%)\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":107530,"task":"image-sentence alignment","parent_task":"Multimodal Text and Image Classification","dataset":"VALSE foil-it (noun phrases)","model_name":"GPT1","metrics":{"pairwise accuracy":"77.5"},"paper_url":"https://arxiv.org/abs/2112.07566v2","paper_title":"VALSE: A Task-Independent Benchmark for Vision and Language Models Centered on Linguistic Phenomena","paper_date":"2021-12-14","code_links":[{"title":"heidelberg-nlp/valse","url":"https://github.com/heidelberg-nlp/valse"}],"metrics_order":"[\"pairwise accuracy\", \"Accuracy (%)\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":107531,"task":"image-sentence alignment","parent_task":"Multimodal Text and Image Classification","dataset":"VALSE foil-it (noun phrases)","model_name":"VisualBERT","metrics":{"Accuracy (%)":"46.6","pairwise accuracy":"48.5"},"paper_url":"https://arxiv.org/abs/2112.07566v2","paper_title":"VALSE: A Task-Independent Benchmark for Vision and Language Models Centered on Linguistic Phenomena","paper_date":"2021-12-14","code_links":[{"title":"heidelberg-nlp/valse","url":"https://github.com/heidelberg-nlp/valse"}],"metrics_order":"[\"pairwise accuracy\", \"Accuracy (%)\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":129449,"task":"image-sentence alignment","parent_task":"Multimodal Text and Image Classification","dataset":"VALSE foil-it (noun phrases)","model_name":"CLIP","metrics":{"pairwise accuracy":"88.8"},"paper_url":"https://arxiv.org/abs/2112.07566v2","paper_title":"VALSE: A Task-Independent Benchmark for Vision and Language Models Centered on Linguistic Phenomena","paper_date":"2021-12-14","code_links":[{"title":"heidelberg-nlp/valse","url":"https://github.com/heidelberg-nlp/valse"}],"metrics_order":"[\"pairwise accuracy\", \"Accuracy (%)\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":129450,"task":"image-sentence alignment","parent_task":"Multimodal Text and Image Classification","dataset":"VALSE foil-it (noun phrases)","model_name":"LXMERT","metrics":{"Accuracy (%)":"70.8","pairwise accuracy":"87.1"},"paper_url":"https://arxiv.org/abs/2112.07566v2","paper_title":"VALSE: A Task-Independent Benchmark for Vision and Language Models Centered on Linguistic Phenomena","paper_date":"2021-12-14","code_links":[{"title":"heidelberg-nlp/valse","url":"https://github.com/heidelberg-nlp/valse"}],"metrics_order":"[\"pairwise accuracy\", \"Accuracy (%)\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":129451,"task":"image-sentence alignment","parent_task":"Multimodal Text and Image Classification","dataset":"VALSE foil-it (noun phrases)","model_name":"ViLBERT 12-in-1","metrics":{"Accuracy (%)":"71.5","pairwise accuracy":"86.9"},"paper_url":"https://arxiv.org/abs/2112.07566v2","paper_title":"VALSE: A Task-Independent Benchmark for Vision and Language Models Centered on Linguistic Phenomena","paper_date":"2021-12-14","code_links":[{"title":"heidelberg-nlp/valse","url":"https://github.com/heidelberg-nlp/valse"}],"metrics_order":"[\"pairwise accuracy\", \"Accuracy (%)\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":129452,"task":"image-sentence alignment","parent_task":"Multimodal Text and Image Classification","dataset":"VALSE foil-it (noun phrases)","model_name":"ViLBERT","metrics":{"Accuracy (%)":"55.9","pairwise accuracy":"86.9"},"paper_url":"https://arxiv.org/abs/2112.07566v2","paper_title":"VALSE: A Task-Independent Benchmark for Vision and Language Models Centered on Linguistic Phenomena","paper_date":"2021-12-14","code_links":[{"title":"heidelberg-nlp/valse","url":"https://github.com/heidelberg-nlp/valse"}],"metrics_order":"[\"pairwise accuracy\", \"Accuracy (%)\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":129453,"task":"image-sentence alignment","parent_task":"Multimodal Text and Image Classification","dataset":"VALSE foil-it (noun phrases)","model_name":"GPT2","metrics":{"pairwise accuracy":"80.7"},"paper_url":"https://arxiv.org/abs/2112.07566v2","paper_title":"VALSE: A Task-Independent Benchmark for Vision and Language Models Centered on Linguistic Phenomena","paper_date":"2021-12-14","code_links":[{"title":"heidelberg-nlp/valse","url":"https://github.com/heidelberg-nlp/valse"}],"metrics_order":"[\"pairwise accuracy\", \"Accuracy (%)\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":129454,"task":"image-sentence alignment","parent_task":"Multimodal Text and Image Classification","dataset":"VALSE foil-it (noun phrases)","model_name":"GPT1","metrics":{"pairwise accuracy":"77.5"},"paper_url":"https://arxiv.org/abs/2112.07566v2","paper_title":"VALSE: A Task-Independent Benchmark for Vision and Language Models Centered on Linguistic Phenomena","paper_date":"2021-12-14","code_links":[{"title":"heidelberg-nlp/valse","url":"https://github.com/heidelberg-nlp/valse"}],"metrics_order":"[\"pairwise accuracy\", \"Accuracy (%)\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":129455,"task":"image-sentence alignment","parent_task":"Multimodal Text and Image Classification","dataset":"VALSE foil-it (noun phrases)","model_name":"VisualBERT","metrics":{"Accuracy (%)":"46.6","pairwise accuracy":"48.5"},"paper_url":"https://arxiv.org/abs/2112.07566v2","paper_title":"VALSE: A Task-Independent Benchmark for Vision and Language Models Centered on Linguistic Phenomena","paper_date":"2021-12-14","code_links":[{"title":"heidelberg-nlp/valse","url":"https://github.com/heidelberg-nlp/valse"}],"metrics_order":"[\"pairwise accuracy\", \"Accuracy (%)\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]}]}