{"task":"Visual Grounding","dataset":"RefCOCO+ test B","metric_names":["Accuracy (%)"],"rows":[{"id":115257,"task":"Visual Grounding","parent_task":null,"dataset":"RefCOCO+ test B","model_name":"Florence-2-large-ft","metrics":{"Accuracy (%)":"92.0"},"paper_url":"https://arxiv.org/abs/2311.06242v1","paper_title":"Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks","paper_date":"2023-11-10","code_links":[{"title":"retkowsky/florence-2","url":"https://github.com/retkowsky/florence-2"}],"metrics_order":"[\"Accuracy (%)\"]","area":"Computer Vision","uses_additional_data":1,"source":"archive","tags":[]},{"id":115258,"task":"Visual Grounding","parent_task":null,"dataset":"RefCOCO+ test B","model_name":"mPLUG-2","metrics":{"Accuracy (%)":"86.05"},"paper_url":"https://arxiv.org/abs/2302.00402v1","paper_title":"mPLUG-2: A Modularized Multi-modal Foundation Model Across Text, Image and Video","paper_date":"2023-02-01","code_links":[{"title":"modelscope/modelscope","url":"https://github.com/modelscope/modelscope"},{"title":"x-plug/mplug-owl","url":"https://github.com/x-plug/mplug-owl"},{"title":"alibaba/AliceMind","url":"https://github.com/alibaba/AliceMind"},{"title":"X-PLUG/mPLUG-2","url":"https://github.com/X-PLUG/mPLUG-2"}],"metrics_order":"[\"Accuracy (%)\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":115259,"task":"Visual Grounding","parent_task":null,"dataset":"RefCOCO+ test B","model_name":"X2-VLM (large)","metrics":{"Accuracy (%)":"81.8"},"paper_url":"https://arxiv.org/abs/2211.12402v2","paper_title":"X$^2$-VLM: All-In-One Pre-trained Model For Vision-Language Tasks","paper_date":"2022-11-22","code_links":[{"title":"zengyan-97/x-vlm","url":"https://github.com/zengyan-97/x-vlm"},{"title":"zengyan-97/x2-vlm","url":"https://github.com/zengyan-97/x2-vlm"}],"metrics_order":"[\"Accuracy (%)\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":115260,"task":"Visual Grounding","parent_task":null,"dataset":"RefCOCO+ test B","model_name":"XFM (base)","metrics":{"Accuracy (%)":"79.8"},"paper_url":"https://arxiv.org/abs/2301.05065v2","paper_title":"Toward Building General Foundation Models for Language, Vision, and Vision-Language Understanding Tasks","paper_date":"2023-01-12","code_links":[{"title":"zhangxinsong-nlp/XFM","url":"https://github.com/zhangxinsong-nlp/XFM"}],"metrics_order":"[\"Accuracy (%)\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":115261,"task":"Visual Grounding","parent_task":null,"dataset":"RefCOCO+ test B","model_name":"X2-VLM (base)","metrics":{"Accuracy (%)":"78.4"},"paper_url":"https://arxiv.org/abs/2211.12402v2","paper_title":"X$^2$-VLM: All-In-One Pre-trained Model For Vision-Language Tasks","paper_date":"2022-11-22","code_links":[{"title":"zengyan-97/x-vlm","url":"https://github.com/zengyan-97/x-vlm"},{"title":"zengyan-97/x2-vlm","url":"https://github.com/zengyan-97/x2-vlm"}],"metrics_order":"[\"Accuracy (%)\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":115262,"task":"Visual Grounding","parent_task":null,"dataset":"RefCOCO+ test B","model_name":"X-VLM (base)","metrics":{"Accuracy (%)":"76.91"},"paper_url":"https://arxiv.org/abs/2111.08276v3","paper_title":"Multi-Grained Vision Language Pre-Training: Aligning Texts with Visual Concepts","paper_date":"2021-11-16","code_links":[{"title":"zengyan-97/x-vlm","url":"https://github.com/zengyan-97/x-vlm"}],"metrics_order":"[\"Accuracy (%)\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]}]}