{"task":"Visual Commonsense Reasoning","dataset":"VCR (Q-A) dev","metric_names":["Accuracy"],"rows":[{"id":31760,"task":"Visual Commonsense Reasoning","parent_task":"Visual Reasoning","dataset":"VCR (Q-A) dev","model_name":"PEVL","metrics":{"Accuracy":"75.1"},"paper_url":"https://arxiv.org/abs/2205.11169v2","paper_title":"PEVL: Position-enhanced Pre-training and Prompt Tuning for Vision-language Models","paper_date":"2022-05-23","code_links":[{"title":"thunlp/pevl","url":"https://github.com/thunlp/pevl"}],"metrics_order":"[\"Accuracy\"]","area":"Reasoning","uses_additional_data":0,"source":"archive","tags":[]}]}