{"task":"Visual Grounding","dataset":"RefCOCO+ testA","metric_names":["Accuracy (%)","IoU"],"rows":[{"id":115270,"task":"Visual Grounding","parent_task":null,"dataset":"RefCOCO+ testA","model_name":"Florence-2-large-ft","metrics":{"Accuracy (%)":" 95.3"},"paper_url":"https://arxiv.org/abs/2311.06242v1","paper_title":"Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks","paper_date":"2023-11-10","code_links":[{"title":"retkowsky/florence-2","url":"https://github.com/retkowsky/florence-2"}],"metrics_order":"[\"Accuracy (%)\", \"IoU\"]","area":"Computer Vision","uses_additional_data":1,"source":"archive","tags":[]},{"id":115271,"task":"Visual Grounding","parent_task":null,"dataset":"RefCOCO+ testA","model_name":"mPLUG-2","metrics":{"Accuracy (%)":"92.8"},"paper_url":"https://arxiv.org/abs/2302.00402v1","paper_title":"mPLUG-2: A Modularized Multi-modal Foundation Model Across Text, Image and Video","paper_date":"2023-02-01","code_links":[{"title":"modelscope/modelscope","url":"https://github.com/modelscope/modelscope"},{"title":"x-plug/mplug-owl","url":"https://github.com/x-plug/mplug-owl"},{"title":"alibaba/AliceMind","url":"https://github.com/alibaba/AliceMind"},{"title":"X-PLUG/mPLUG-2","url":"https://github.com/X-PLUG/mPLUG-2"}],"metrics_order":"[\"Accuracy (%)\", \"IoU\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":115272,"task":"Visual Grounding","parent_task":null,"dataset":"RefCOCO+ testA","model_name":"X2-VLM (large)","metrics":{"Accuracy (%)":"92.1"},"paper_url":"https://arxiv.org/abs/2211.12402v2","paper_title":"X$^2$-VLM: All-In-One Pre-trained Model For Vision-Language Tasks","paper_date":"2022-11-22","code_links":[{"title":"zengyan-97/x-vlm","url":"https://github.com/zengyan-97/x-vlm"},{"title":"zengyan-97/x2-vlm","url":"https://github.com/zengyan-97/x2-vlm"}],"metrics_order":"[\"Accuracy (%)\", \"IoU\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":115273,"task":"Visual Grounding","parent_task":null,"dataset":"RefCOCO+ testA","model_name":"XFM (base)","metrics":{"Accuracy (%)":"90.4"},"paper_url":"https://arxiv.org/abs/2301.05065v2","paper_title":"Toward Building General Foundation Models for Language, Vision, and Vision-Language Understanding Tasks","paper_date":"2023-01-12","code_links":[{"title":"zhangxinsong-nlp/XFM","url":"https://github.com/zhangxinsong-nlp/XFM"}],"metrics_order":"[\"Accuracy (%)\", \"IoU\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":115274,"task":"Visual Grounding","parent_task":null,"dataset":"RefCOCO+ testA","model_name":"X2-VLM (base)","metrics":{"Accuracy (%)":"90.3"},"paper_url":"https://arxiv.org/abs/2211.12402v2","paper_title":"X$^2$-VLM: All-In-One Pre-trained Model For Vision-Language Tasks","paper_date":"2022-11-22","code_links":[{"title":"zengyan-97/x-vlm","url":"https://github.com/zengyan-97/x-vlm"},{"title":"zengyan-97/x2-vlm","url":"https://github.com/zengyan-97/x2-vlm"}],"metrics_order":"[\"Accuracy (%)\", \"IoU\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":115275,"task":"Visual Grounding","parent_task":null,"dataset":"RefCOCO+ testA","model_name":"X-VLM (base)","metrics":{"Accuracy (%)":"89.00"},"paper_url":"https://arxiv.org/abs/2111.08276v3","paper_title":"Multi-Grained Vision Language Pre-Training: Aligning Texts with Visual Concepts","paper_date":"2021-11-16","code_links":[{"title":"zengyan-97/x-vlm","url":"https://github.com/zengyan-97/x-vlm"}],"metrics_order":"[\"Accuracy (%)\", \"IoU\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":115276,"task":"Visual Grounding","parent_task":null,"dataset":"RefCOCO+ testA","model_name":"HYDRA","metrics":{"IoU":"61.1"},"paper_url":"https://arxiv.org/abs/2403.12884v2","paper_title":"HYDRA: A Hyper Agent for Dynamic Compositional Visual Reasoning","paper_date":"2024-03-19","code_links":[{"title":"ControlNet/HYDRA","url":"https://github.com/ControlNet/HYDRA"}],"metrics_order":"[\"Accuracy (%)\", \"IoU\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]}]}