{"task":"Visual Grounding","dataset":"RefCOCO+ val","metric_names":["Accuracy (%)"],"rows":[{"id":115264,"task":"Visual Grounding","parent_task":null,"dataset":"RefCOCO+ val","model_name":"Florence-2-large-ft","metrics":{"Accuracy (%)":"93.4"},"paper_url":"https://arxiv.org/abs/2311.06242v1","paper_title":"Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks","paper_date":"2023-11-10","code_links":[{"title":"retkowsky/florence-2","url":"https://github.com/retkowsky/florence-2"}],"metrics_order":"[\"Accuracy (%)\"]","area":"Computer Vision","uses_additional_data":1,"source":"archive","tags":[]},{"id":115265,"task":"Visual Grounding","parent_task":null,"dataset":"RefCOCO+ val","model_name":"mPLUG-2","metrics":{"Accuracy (%)":"90.33"},"paper_url":"https://arxiv.org/abs/2302.00402v1","paper_title":"mPLUG-2: A Modularized Multi-modal Foundation Model Across Text, Image and Video","paper_date":"2023-02-01","code_links":[{"title":"modelscope/modelscope","url":"https://github.com/modelscope/modelscope"},{"title":"x-plug/mplug-owl","url":"https://github.com/x-plug/mplug-owl"},{"title":"alibaba/AliceMind","url":"https://github.com/alibaba/AliceMind"},{"title":"X-PLUG/mPLUG-2","url":"https://github.com/X-PLUG/mPLUG-2"}],"metrics_order":"[\"Accuracy (%)\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":115266,"task":"Visual Grounding","parent_task":null,"dataset":"RefCOCO+ val","model_name":"X2-VLM (large)","metrics":{"Accuracy (%)":"87.6"},"paper_url":"https://arxiv.org/abs/2211.12402v2","paper_title":"X$^2$-VLM: All-In-One Pre-trained Model For Vision-Language Tasks","paper_date":"2022-11-22","code_links":[{"title":"zengyan-97/x-vlm","url":"https://github.com/zengyan-97/x-vlm"},{"title":"zengyan-97/x2-vlm","url":"https://github.com/zengyan-97/x2-vlm"}],"metrics_order":"[\"Accuracy (%)\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":115267,"task":"Visual Grounding","parent_task":null,"dataset":"RefCOCO+ val","model_name":"XFM (base)","metrics":{"Accuracy (%)":"86.1"},"paper_url":"https://arxiv.org/abs/2301.05065v2","paper_title":"Toward Building General Foundation Models for Language, Vision, and Vision-Language Understanding Tasks","paper_date":"2023-01-12","code_links":[{"title":"zhangxinsong-nlp/XFM","url":"https://github.com/zhangxinsong-nlp/XFM"}],"metrics_order":"[\"Accuracy (%)\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":115268,"task":"Visual Grounding","parent_task":null,"dataset":"RefCOCO+ val","model_name":"X2-VLM (base)","metrics":{"Accuracy (%)":"85.2"},"paper_url":"https://arxiv.org/abs/2211.12402v2","paper_title":"X$^2$-VLM: All-In-One Pre-trained Model For Vision-Language Tasks","paper_date":"2022-11-22","code_links":[{"title":"zengyan-97/x-vlm","url":"https://github.com/zengyan-97/x-vlm"},{"title":"zengyan-97/x2-vlm","url":"https://github.com/zengyan-97/x2-vlm"}],"metrics_order":"[\"Accuracy (%)\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":115269,"task":"Visual Grounding","parent_task":null,"dataset":"RefCOCO+ val","model_name":"X-VLM (base)","metrics":{"Accuracy (%)":"84.51"},"paper_url":"https://arxiv.org/abs/2111.08276v3","paper_title":"Multi-Grained Vision Language Pre-Training: Aligning Texts with Visual Concepts","paper_date":"2021-11-16","code_links":[{"title":"zengyan-97/x-vlm","url":"https://github.com/zengyan-97/x-vlm"}],"metrics_order":"[\"Accuracy (%)\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]}]}