{"task":"Human Judgment Classification","dataset":"Pascal-50S","metric_names":["Mean Accuracy"],"rows":[{"id":128673,"task":"Human Judgment Classification","parent_task":null,"dataset":"Pascal-50S","model_name":"MID","metrics":{"Mean Accuracy":"85.2"},"paper_url":"https://arxiv.org/abs/2205.13445v1","paper_title":"Mutual Information Divergence: A Unified Metric for Multimodal Generative Models","paper_date":"2022-05-25","code_links":[{"title":"naver-ai/mid.metric","url":"https://github.com/naver-ai/mid.metric"}],"metrics_order":"[\"Mean Accuracy\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":128674,"task":"Human Judgment Classification","parent_task":null,"dataset":"Pascal-50S","model_name":"RefCLIP-S","metrics":{"Mean Accuracy":"83.1"},"paper_url":"https://arxiv.org/abs/2104.08718v3","paper_title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","paper_date":"2021-04-18","code_links":[{"title":"jmhessel/clipscore","url":"https://github.com/jmhessel/clipscore"},{"title":"showlab/loveu-tgve-2023","url":"https://github.com/showlab/loveu-tgve-2023"},{"title":"jmhessel/pycocoevalcap","url":"https://github.com/jmhessel/pycocoevalcap"}],"metrics_order":"[\"Mean Accuracy\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]},{"id":128675,"task":"Human Judgment Classification","parent_task":null,"dataset":"Pascal-50S","model_name":"CLIP-S","metrics":{"Mean Accuracy":"80.7"},"paper_url":"https://arxiv.org/abs/2104.08718v3","paper_title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","paper_date":"2021-04-18","code_links":[{"title":"jmhessel/clipscore","url":"https://github.com/jmhessel/clipscore"},{"title":"showlab/loveu-tgve-2023","url":"https://github.com/showlab/loveu-tgve-2023"},{"title":"jmhessel/pycocoevalcap","url":"https://github.com/jmhessel/pycocoevalcap"}],"metrics_order":"[\"Mean Accuracy\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]}]}