{"task":"image-sentence alignment","dataset":"VALSE","metric_names":["average pairwise accuracy","Average Accuracy"],"rows":[{"id":107602,"task":"image-sentence alignment","parent_task":"Multimodal Text and Image Classification","dataset":"VALSE","model_name":"ViLBERT 12-in-1","metrics":{"Average Accuracy":"63.2","average pairwise accuracy":"75.1"},"paper_url":"https://arxiv.org/abs/2112.07566v2","paper_title":"VALSE: A Task-Independent Benchmark for Vision and Language Models Centered on Linguistic Phenomena","paper_date":"2021-12-14","code_links":[{"title":"heidelberg-nlp/valse","url":"https://github.com/heidelberg-nlp/valse"}],"metrics_order":"[\"average pairwise accuracy\", \"Average Accuracy\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":107603,"task":"image-sentence alignment","parent_task":"Multimodal Text and Image Classification","dataset":"VALSE","model_name":"CLIP","metrics":{"average pairwise accuracy":"64.0"},"paper_url":"https://arxiv.org/abs/2112.07566v2","paper_title":"VALSE: A Task-Independent Benchmark for Vision and Language Models Centered on Linguistic Phenomena","paper_date":"2021-12-14","code_links":[{"title":"heidelberg-nlp/valse","url":"https://github.com/heidelberg-nlp/valse"}],"metrics_order":"[\"average pairwise accuracy\", \"Average Accuracy\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":107604,"task":"image-sentence alignment","parent_task":"Multimodal Text and Image Classification","dataset":"VALSE","model_name":"ViLBERT","metrics":{"Average Accuracy":"51.3","average pairwise accuracy":"63.7"},"paper_url":"https://arxiv.org/abs/2112.07566v2","paper_title":"VALSE: A Task-Independent Benchmark for Vision and Language Models Centered on Linguistic Phenomena","paper_date":"2021-12-14","code_links":[{"title":"heidelberg-nlp/valse","url":"https://github.com/heidelberg-nlp/valse"}],"metrics_order":"[\"average pairwise accuracy\", \"Average Accuracy\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":107605,"task":"image-sentence alignment","parent_task":"Multimodal Text and Image Classification","dataset":"VALSE","model_name":"GPT1","metrics":{"average pairwise accuracy":"60.7"},"paper_url":"https://arxiv.org/abs/2112.07566v2","paper_title":"VALSE: A Task-Independent Benchmark for Vision and Language Models Centered on Linguistic Phenomena","paper_date":"2021-12-14","code_links":[{"title":"heidelberg-nlp/valse","url":"https://github.com/heidelberg-nlp/valse"}],"metrics_order":"[\"average pairwise accuracy\", \"Average Accuracy\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":107606,"task":"image-sentence alignment","parent_task":"Multimodal Text and Image Classification","dataset":"VALSE","model_name":"GPT2","metrics":{"average pairwise accuracy":"60.1"},"paper_url":"https://arxiv.org/abs/2112.07566v2","paper_title":"VALSE: A Task-Independent Benchmark for Vision and Language Models Centered on Linguistic Phenomena","paper_date":"2021-12-14","code_links":[{"title":"heidelberg-nlp/valse","url":"https://github.com/heidelberg-nlp/valse"}],"metrics_order":"[\"average pairwise accuracy\", \"Average Accuracy\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":107607,"task":"image-sentence alignment","parent_task":"Multimodal Text and Image Classification","dataset":"VALSE","model_name":"LXMERT","metrics":{"Average Accuracy":"53.5","average pairwise accuracy":"59.6"},"paper_url":"https://arxiv.org/abs/2112.07566v2","paper_title":"VALSE: A Task-Independent Benchmark for Vision and Language Models Centered on Linguistic Phenomena","paper_date":"2021-12-14","code_links":[{"title":"heidelberg-nlp/valse","url":"https://github.com/heidelberg-nlp/valse"}],"metrics_order":"[\"average pairwise accuracy\", \"Average Accuracy\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":107608,"task":"image-sentence alignment","parent_task":"Multimodal Text and Image Classification","dataset":"VALSE","model_name":"VisualBERT","metrics":{"Average Accuracy":"48.8","average pairwise accuracy":"46.4"},"paper_url":"https://arxiv.org/abs/2112.07566v2","paper_title":"VALSE: A Task-Independent Benchmark for Vision and Language Models Centered on Linguistic Phenomena","paper_date":"2021-12-14","code_links":[{"title":"heidelberg-nlp/valse","url":"https://github.com/heidelberg-nlp/valse"}],"metrics_order":"[\"average pairwise accuracy\", \"Average Accuracy\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":129526,"task":"image-sentence alignment","parent_task":"Multimodal Text and Image Classification","dataset":"VALSE","model_name":"ViLBERT 12-in-1","metrics":{"Average Accuracy":"63.2","average pairwise accuracy":"75.1"},"paper_url":"https://arxiv.org/abs/2112.07566v2","paper_title":"VALSE: A Task-Independent Benchmark for Vision and Language Models Centered on Linguistic Phenomena","paper_date":"2021-12-14","code_links":[{"title":"heidelberg-nlp/valse","url":"https://github.com/heidelberg-nlp/valse"}],"metrics_order":"[\"average pairwise accuracy\", \"Average Accuracy\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":129527,"task":"image-sentence alignment","parent_task":"Multimodal Text and Image Classification","dataset":"VALSE","model_name":"CLIP","metrics":{"average pairwise accuracy":"64.0"},"paper_url":"https://arxiv.org/abs/2112.07566v2","paper_title":"VALSE: A Task-Independent Benchmark for Vision and Language Models Centered on Linguistic Phenomena","paper_date":"2021-12-14","code_links":[{"title":"heidelberg-nlp/valse","url":"https://github.com/heidelberg-nlp/valse"}],"metrics_order":"[\"average pairwise accuracy\", \"Average Accuracy\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":129528,"task":"image-sentence alignment","parent_task":"Multimodal Text and Image Classification","dataset":"VALSE","model_name":"ViLBERT","metrics":{"Average Accuracy":"51.3","average pairwise accuracy":"63.7"},"paper_url":"https://arxiv.org/abs/2112.07566v2","paper_title":"VALSE: A Task-Independent Benchmark for Vision and Language Models Centered on Linguistic Phenomena","paper_date":"2021-12-14","code_links":[{"title":"heidelberg-nlp/valse","url":"https://github.com/heidelberg-nlp/valse"}],"metrics_order":"[\"average pairwise accuracy\", \"Average Accuracy\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":129529,"task":"image-sentence alignment","parent_task":"Multimodal Text and Image Classification","dataset":"VALSE","model_name":"GPT1","metrics":{"average pairwise accuracy":"60.7"},"paper_url":"https://arxiv.org/abs/2112.07566v2","paper_title":"VALSE: A Task-Independent Benchmark for Vision and Language Models Centered on Linguistic Phenomena","paper_date":"2021-12-14","code_links":[{"title":"heidelberg-nlp/valse","url":"https://github.com/heidelberg-nlp/valse"}],"metrics_order":"[\"average pairwise accuracy\", \"Average Accuracy\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":129530,"task":"image-sentence alignment","parent_task":"Multimodal Text and Image Classification","dataset":"VALSE","model_name":"GPT2","metrics":{"average pairwise accuracy":"60.1"},"paper_url":"https://arxiv.org/abs/2112.07566v2","paper_title":"VALSE: A Task-Independent Benchmark for Vision and Language Models Centered on Linguistic Phenomena","paper_date":"2021-12-14","code_links":[{"title":"heidelberg-nlp/valse","url":"https://github.com/heidelberg-nlp/valse"}],"metrics_order":"[\"average pairwise accuracy\", \"Average Accuracy\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":129531,"task":"image-sentence alignment","parent_task":"Multimodal Text and Image Classification","dataset":"VALSE","model_name":"LXMERT","metrics":{"Average Accuracy":"53.5","average pairwise accuracy":"59.6"},"paper_url":"https://arxiv.org/abs/2112.07566v2","paper_title":"VALSE: A Task-Independent Benchmark for Vision and Language Models Centered on Linguistic Phenomena","paper_date":"2021-12-14","code_links":[{"title":"heidelberg-nlp/valse","url":"https://github.com/heidelberg-nlp/valse"}],"metrics_order":"[\"average pairwise accuracy\", \"Average Accuracy\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":129532,"task":"image-sentence alignment","parent_task":"Multimodal Text and Image Classification","dataset":"VALSE","model_name":"VisualBERT","metrics":{"Average Accuracy":"48.8","average pairwise accuracy":"46.4"},"paper_url":"https://arxiv.org/abs/2112.07566v2","paper_title":"VALSE: A Task-Independent Benchmark for Vision and Language Models Centered on Linguistic Phenomena","paper_date":"2021-12-14","code_links":[{"title":"heidelberg-nlp/valse","url":"https://github.com/heidelberg-nlp/valse"}],"metrics_order":"[\"average pairwise accuracy\", \"Average Accuracy\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]}]}