{"task":"Visual Question Answering (VQA)","dataset":"CLEVR","metric_names":["Accuracy"],"rows":[{"id":25904,"task":"Visual Question Answering (VQA)","parent_task":null,"dataset":"CLEVR","model_name":"NS-VQA (1K programs)","metrics":{"Accuracy":"99.8"},"paper_url":"http://arxiv.org/abs/1810.02338v2","paper_title":"Neural-Symbolic VQA: Disentangling Reasoning from Vision and Language Understanding","paper_date":"2018-10-04","code_links":[{"title":"kexinyi/ns-vqa","url":"https://github.com/kexinyi/ns-vqa"},{"title":"nerdimite/neuro-symbolic-ai-soc","url":"https://github.com/nerdimite/neuro-symbolic-ai-soc"}],"metrics_order":"[\"Accuracy\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":25905,"task":"Visual Question Answering (VQA)","parent_task":null,"dataset":"CLEVR","model_name":"MDETR","metrics":{"Accuracy":"99.7"},"paper_url":"https://arxiv.org/abs/2104.12763v2","paper_title":"MDETR -- Modulated Detection for End-to-End Multi-Modal Understanding","paper_date":"2021-04-26","code_links":[{"title":"facebookresearch/multimodal","url":"https://github.com/facebookresearch/multimodal"},{"title":"ashkamath/mdetr","url":"https://github.com/ashkamath/mdetr"},{"title":"thunlp/pevl","url":"https://github.com/thunlp/pevl"},{"title":"b-faye/lightmdetr","url":"https://github.com/b-faye/lightmdetr"},{"title":"AleDella/mdter_eval","url":"https://github.com/AleDella/mdter_eval"}],"metrics_order":"[\"Accuracy\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":25906,"task":"Visual Question Answering (VQA)","parent_task":null,"dataset":"CLEVR","model_name":"NeSyCoCo","metrics":{"Accuracy":"99.7"},"paper_url":"https://arxiv.org/abs/2412.15588v1","paper_title":"NeSyCoCo: A Neuro-Symbolic Concept Composer for Compositional Generalization","paper_date":"2024-12-20","code_links":[{"title":"hlr/nesycoco","url":"https://github.com/hlr/nesycoco"}],"metrics_order":"[\"Accuracy\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":25907,"task":"Visual Question Answering (VQA)","parent_task":null,"dataset":"CLEVR","model_name":"OCCAM (ours)","metrics":{"Accuracy":"99.4"},"paper_url":"https://arxiv.org/abs/2011.11603v2","paper_title":"Interpretable Visual Reasoning via Induced Symbolic Space","paper_date":"2020-11-23","code_links":[{"title":"SHI-Labs/Interpretable-Visual-Reasoning","url":"https://github.com/SHI-Labs/Interpretable-Visual-Reasoning"}],"metrics_order":"[\"Accuracy\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":25908,"task":"Visual Question Answering (VQA)","parent_task":null,"dataset":"CLEVR","model_name":"TbD + reg + hres","metrics":{"Accuracy":"99.1"},"paper_url":"http://arxiv.org/abs/1803.05268v2","paper_title":"Transparency by Design: Closing the Gap Between Performance and Interpretability in Visual Reasoning","paper_date":"2018-03-14","code_links":[{"title":"davidmascharka/tbd-nets","url":"https://github.com/davidmascharka/tbd-nets"}],"metrics_order":"[\"Accuracy\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":25909,"task":"Visual Question Answering (VQA)","parent_task":null,"dataset":"CLEVR","model_name":"NS-CL","metrics":{"Accuracy":"98.9"},"paper_url":"http://arxiv.org/abs/1904.12584v1","paper_title":"The Neuro-Symbolic Concept Learner: Interpreting Scenes, Words, and Sentences From Natural Supervision","paper_date":"2019-04-26","code_links":[{"title":"vacancy/NSCL-PyTorch-Release","url":"https://github.com/vacancy/NSCL-PyTorch-Release"},{"title":"nerdimite/neuro-symbolic-ai-soc","url":"https://github.com/nerdimite/neuro-symbolic-ai-soc"}],"metrics_order":"[\"Accuracy\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":25910,"task":"Visual Question Answering (VQA)","parent_task":null,"dataset":"CLEVR","model_name":"MAC","metrics":{"Accuracy":"98.9"},"paper_url":"http://arxiv.org/abs/1803.03067v2","paper_title":"Compositional Attention Networks for Machine Reasoning","paper_date":"2018-03-08","code_links":[{"title":"stanfordnlp/mac-network","url":"https://github.com/stanfordnlp/mac-network"},{"title":"rosinality/mac-network-pytorch","url":"https://github.com/rosinality/mac-network-pytorch"},{"title":"Glaciohound/VCML","url":"https://github.com/Glaciohound/VCML"},{"title":"kakao/DAFT","url":"https://github.com/kakao/DAFT"},{"title":"ronilp/mac-network-pytorch-gqa","url":"https://github.com/ronilp/mac-network-pytorch-gqa"},{"title":"ceyzaguirre4/DACT-MAC","url":"https://github.com/ceyzaguirre4/DACT-MAC"},{"title":"tohinz/pytorch-mac-network","url":"https://github.com/tohinz/pytorch-mac-network"},{"title":"ceyzaguirre4/mac-network-pytorch","url":"https://github.com/ceyzaguirre4/mac-network-pytorch"},{"title":"adlnlp/attention_vl","url":"https://github.com/adlnlp/attention_vl"},{"title":"ivegner/Multi-Memory-MAC-Network","url":"https://github.com/ivegner/Multi-Memory-MAC-Network"}],"metrics_order":"[\"Accuracy\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":25911,"task":"Visual Question Answering (VQA)","parent_task":null,"dataset":"CLEVR","model_name":"CNN + LSTM + RN + HAN","metrics":{"Accuracy":"98.8"},"paper_url":"http://arxiv.org/abs/1808.00300v1","paper_title":"Learning Visual Question Answering by Bootstrapping Hard Attention","paper_date":"2018-08-01","code_links":[{"title":"lienchibao1998/new","url":"https://github.com/lienchibao1998/new"}],"metrics_order":"[\"Accuracy\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":25912,"task":"Visual Question Answering (VQA)","parent_task":null,"dataset":"CLEVR","model_name":"DDRprog*","metrics":{"Accuracy":"98.3"},"paper_url":"http://arxiv.org/abs/1803.11361v1","paper_title":"DDRprog: A CLEVR Differentiable Dynamic Reasoning Programmer","paper_date":"2018-03-30","code_links":[],"metrics_order":"[\"Accuracy\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":25913,"task":"Visual Question Answering (VQA)","parent_task":null,"dataset":"CLEVR","model_name":"single-hop + LCGN (ours)","metrics":{"Accuracy":"97.9"},"paper_url":"https://arxiv.org/abs/1905.04405v2","paper_title":"Language-Conditioned Graph Networks for Relational Reasoning","paper_date":"2019-05-10","code_links":[{"title":"ronghanghu/lcgn","url":"https://github.com/ronghanghu/lcgn"}],"metrics_order":"[\"Accuracy\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":25914,"task":"Visual Question Answering (VQA)","parent_task":null,"dataset":"CLEVR","model_name":"CNN+GRU+FiLM","metrics":{"Accuracy":"97.7"},"paper_url":"http://arxiv.org/abs/1709.07871v2","paper_title":"FiLM: Visual Reasoning with a General Conditioning Layer","paper_date":"2017-09-22","code_links":[{"title":"kdaip/stabletts","url":"https://github.com/kdaip/stabletts"},{"title":"ethanjperez/film","url":"https://github.com/ethanjperez/film"},{"title":"caffeinism/film-pytorch","url":"https://github.com/caffeinism/film-pytorch"},{"title":"keonlee9420/Daft-Exprt","url":"https://github.com/keonlee9420/Daft-Exprt"},{"title":"jjgo/hyperlight","url":"https://github.com/jjgo/hyperlight"},{"title":"CPJKU/audio_conditioned_unet","url":"https://github.com/CPJKU/audio_conditioned_unet"},{"title":"GuessWhatGame/clevr","url":"https://github.com/GuessWhatGame/clevr"}],"metrics_order":"[\"Accuracy\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":25915,"task":"Visual Question Answering (VQA)","parent_task":null,"dataset":"CLEVR","model_name":"XNM-Det supervised","metrics":{"Accuracy":"97.7"},"paper_url":"http://arxiv.org/abs/1812.01855v2","paper_title":"Explainable and Explicit Visual Reasoning over Scene Graphs","paper_date":"2018-12-05","code_links":[{"title":"shijx12/XNM-Net","url":"https://github.com/shijx12/XNM-Net"},{"title":"shijx12/shijx12.github.io","url":"https://github.com/shijx12/shijx12.github.io"}],"metrics_order":"[\"Accuracy\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":25916,"task":"Visual Question Answering (VQA)","parent_task":null,"dataset":"CLEVR","model_name":"IEP-700K","metrics":{"Accuracy":"96.9"},"paper_url":"http://arxiv.org/abs/1705.03633v1","paper_title":"Inferring and Executing Programs for Visual Reasoning","paper_date":"2017-05-10","code_links":[{"title":"facebookresearch/clevr-iep","url":"https://github.com/facebookresearch/clevr-iep"},{"title":"ethanjperez/film","url":"https://github.com/ethanjperez/film"},{"title":"AlexKuhnle/film","url":"https://github.com/AlexKuhnle/film"},{"title":"rs9000/VisualReasoning_MMnet","url":"https://github.com/rs9000/VisualReasoning_MMnet"},{"title":"bhanu77prakash/EDA-project","url":"https://github.com/bhanu77prakash/EDA-project"}],"metrics_order":"[\"Accuracy\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":25917,"task":"Visual Question Answering (VQA)","parent_task":null,"dataset":"CLEVR","model_name":"CNN + LSTM + RN","metrics":{"Accuracy":"95.50"},"paper_url":"http://arxiv.org/abs/1706.01427v1","paper_title":"A simple neural network module for relational reasoning","paper_date":"2017-06-05","code_links":[{"title":"kimhc6028/relational-networks","url":"https://github.com/kimhc6028/relational-networks"},{"title":"clvrai/relation-network-tensorflow","url":"https://github.com/clvrai/relation-network-tensorflow"},{"title":"gitlimlab/Relation-Network-Tensorflow","url":"https://github.com/gitlimlab/Relation-Network-Tensorflow"},{"title":"mesnico/RelationNetworks-CLEVR","url":"https://github.com/mesnico/RelationNetworks-CLEVR"},{"title":"rosinality/relation-networks-pytorch","url":"https://github.com/rosinality/relation-networks-pytorch"},{"title":"cnichkawde/MatchingNetwork","url":"https://github.com/cnichkawde/MatchingNetwork"},{"title":"siddk/relation-network","url":"https://github.com/siddk/relation-network"},{"title":"AndreaCossu/Relation-Network-PyTorch","url":"https://github.com/AndreaCossu/Relation-Network-PyTorch"},{"title":"moduIo/Relation-Networks","url":"https://github.com/moduIo/Relation-Networks"},{"title":"mdda/relationships-from-entity-stream","url":"https://github.com/mdda/relationships-from-entity-stream"},{"title":"gngdb/relational","url":"https://github.com/gngdb/relational"},{"title":"rishikmani/sort-of-clevr","url":"https://github.com/rishikmani/sort-of-clevr"},{"title":"jaehyunnn/RelationalNetwork_pytorch","url":"https://github.com/jaehyunnn/RelationalNetwork_pytorch"},{"title":"adriangoe/relational-networks-pytorch","url":"https://github.com/adriangoe/relational-networks-pytorch"},{"title":"IllgamhoDuck/ResTR","url":"https://github.com/IllgamhoDuck/ResTR"},{"title":"yanchunyu71/relational-networks-paddle","url":"https://github.com/yanchunyu71/relational-networks-paddle"},{"title":"nerdimite/relation-network","url":"https://github.com/nerdimite/relation-network"},{"title":"matwilso/relation-networks","url":"https://github.com/matwilso/relation-networks"},{"title":"ttok0s7u2n5/ML2_proj","url":"https://github.com/ttok0s7u2n5/ML2_proj"},{"title":"fcorencoret/dynamic-rn","url":"https://github.com/fcorencoret/dynamic-rn"}],"metrics_order":"[\"Accuracy\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":25918,"task":"Visual Question Answering (VQA)","parent_task":null,"dataset":"CLEVR","model_name":"QGHC+Att+Concat","metrics":{"Accuracy":"65.90"},"paper_url":"http://arxiv.org/abs/1808.02632v1","paper_title":"Question-Guided Hybrid Convolution for Visual Question Answering","paper_date":"2018-08-08","code_links":[],"metrics_order":"[\"Accuracy\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]}]}