{"task":"Generalized Referring Expression Segmentation","dataset":"gRefCOCO","metric_names":["gIoU","cIoU"],"rows":[{"id":86255,"task":"Generalized Referring Expression Segmentation","parent_task":"Referring Expression Segmentation","dataset":"gRefCOCO","model_name":"DeRIS-L","metrics":{"cIoU":"72.00","gIoU":"77.67"},"paper_url":"https://arxiv.org/abs/2507.01738v1","paper_title":"DeRIS: Decoupling Perception and Cognition for Enhanced Referring Image Segmentation through Loopback Synergy","paper_date":"2025-07-02","code_links":[{"title":"Dmmm1997/DeRIS","url":"https://github.com/Dmmm1997/DeRIS"}],"metrics_order":"[\"gIoU\", \"cIoU\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":86256,"task":"Generalized Referring Expression Segmentation","parent_task":"Referring Expression Segmentation","dataset":"gRefCOCO","model_name":"GSVA-Llama2-13B","metrics":{"cIoU":"66.38","gIoU":"70.04"},"paper_url":"https://arxiv.org/abs/2312.10103v3","paper_title":"GSVA: Generalized Segmentation via Multimodal Large Language Models","paper_date":"2023-12-15","code_links":[{"title":"leaplabthu/gsva","url":"https://github.com/leaplabthu/gsva"}],"metrics_order":"[\"gIoU\", \"cIoU\"]","area":"Computer Vision","uses_additional_data":1,"source":"archive","tags":[]},{"id":86257,"task":"Generalized Referring Expression Segmentation","parent_task":"Referring Expression Segmentation","dataset":"gRefCOCO","model_name":"MABP","metrics":{"cIoU":"65.69","gIoU":"68.79"},"paper_url":"https://arxiv.org/abs/2405.15169v2","paper_title":"Bring Adaptive Binding Prototypes to Generalized Referring Expression Segmentation","paper_date":"2024-05-24","code_links":[{"title":"buptlwz/mabp","url":"https://github.com/buptlwz/mabp"}],"metrics_order":"[\"gIoU\", \"cIoU\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":86258,"task":"Generalized Referring Expression Segmentation","parent_task":"Referring Expression Segmentation","dataset":"gRefCOCO","model_name":"HDC","metrics":{"cIoU":"65.42","gIoU":"68.28"},"paper_url":"https://arxiv.org/abs/2405.15658v2","paper_title":"CoHD: A Counting-Aware Hierarchical Decoding Framework for Generalized Referring Expression Segmentation","paper_date":"2024-05-24","code_links":[{"title":"robertluo1/cohd","url":"https://github.com/robertluo1/cohd"},{"title":"RobertLuo1/HDC","url":"https://github.com/RobertLuo1/HDC"}],"metrics_order":"[\"gIoU\", \"cIoU\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":86259,"task":"Generalized Referring Expression Segmentation","parent_task":"Referring Expression Segmentation","dataset":"gRefCOCO","model_name":"GSVA-Vicuna-13B-v1.1","metrics":{"cIoU":"64.05","gIoU":"68.01"},"paper_url":"https://arxiv.org/abs/2312.10103v3","paper_title":"GSVA: Generalized Segmentation via Multimodal Large Language Models","paper_date":"2023-12-15","code_links":[{"title":"leaplabthu/gsva","url":"https://github.com/leaplabthu/gsva"}],"metrics_order":"[\"gIoU\", \"cIoU\"]","area":"Computer Vision","uses_additional_data":1,"source":"archive","tags":[]},{"id":86260,"task":"Generalized Referring Expression Segmentation","parent_task":"Referring Expression Segmentation","dataset":"gRefCOCO","model_name":"GROUNDHOG","metrics":{"gIoU":"66.70"},"paper_url":"https://arxiv.org/abs/2402.16846v2","paper_title":"GROUNDHOG: Grounding Large Language Models to Holistic Segmentation","paper_date":"2024-02-26","code_links":[],"metrics_order":"[\"gIoU\", \"cIoU\"]","area":"Computer Vision","uses_additional_data":1,"source":"archive","tags":[]},{"id":86261,"task":"Generalized Referring Expression Segmentation","parent_task":"Referring Expression Segmentation","dataset":"gRefCOCO","model_name":"GSVA-Vicuna-7B-v1.1","metrics":{"cIoU":"63.29","gIoU":"66.47"},"paper_url":"https://arxiv.org/abs/2312.10103v3","paper_title":"GSVA: Generalized Segmentation via Multimodal Large Language Models","paper_date":"2023-12-15","code_links":[{"title":"leaplabthu/gsva","url":"https://github.com/leaplabthu/gsva"}],"metrics_order":"[\"gIoU\", \"cIoU\"]","area":"Computer Vision","uses_additional_data":1,"source":"archive","tags":[]},{"id":86262,"task":"Generalized Referring Expression Segmentation","parent_task":"Referring Expression Segmentation","dataset":"gRefCOCO","model_name":"ReLA","metrics":{"cIoU":"62.42","gIoU":"63.60"},"paper_url":"https://arxiv.org/abs/2306.00968v1","paper_title":"GRES: Generalized Referring Expression Segmentation","paper_date":"2023-06-01","code_links":[{"title":"henghuiding/ReLA","url":"https://github.com/henghuiding/ReLA"},{"title":"henghuiding/grefcoco","url":"https://github.com/henghuiding/grefcoco"}],"metrics_order":"[\"gIoU\", \"cIoU\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":86263,"task":"Generalized Referring Expression Segmentation","parent_task":"Referring Expression Segmentation","dataset":"gRefCOCO","model_name":"LAVT","metrics":{"cIoU":"57.64","gIoU":"58.40"},"paper_url":"https://arxiv.org/abs/2112.02244v2","paper_title":"LAVT: Language-Aware Vision Transformer for Referring Image Segmentation","paper_date":"2021-12-04","code_links":[{"title":"yz93/lavt-ris","url":"https://github.com/yz93/lavt-ris"}],"metrics_order":"[\"gIoU\", \"cIoU\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":86264,"task":"Generalized Referring Expression Segmentation","parent_task":"Referring Expression Segmentation","dataset":"gRefCOCO","model_name":"CRIS","metrics":{"cIoU":"55.34","gIoU":"56.27"},"paper_url":"https://arxiv.org/abs/2111.15174v2","paper_title":"CRIS: CLIP-Driven Referring Image Segmentation","paper_date":"2021-11-30","code_links":[{"title":"DerrickWang005/CRIS.pytorch","url":"https://github.com/DerrickWang005/CRIS.pytorch"}],"metrics_order":"[\"gIoU\", \"cIoU\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":86265,"task":"Generalized Referring Expression Segmentation","parent_task":"Referring Expression Segmentation","dataset":"gRefCOCO","model_name":"LTS","metrics":{"cIoU":"52.30","gIoU":"52.70"},"paper_url":"https://arxiv.org/abs/2103.16284v1","paper_title":"Locate then Segment: A Strong Pipeline for Referring Image Segmentation","paper_date":"2021-03-30","code_links":[],"metrics_order":"[\"gIoU\", \"cIoU\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":86266,"task":"Generalized Referring Expression Segmentation","parent_task":"Referring Expression Segmentation","dataset":"gRefCOCO","model_name":"VLT","metrics":{"cIoU":"52.51","gIoU":"52.00"},"paper_url":"https://arxiv.org/abs/2108.05565v1","paper_title":"Vision-Language Transformer and Query Generation for Referring Segmentation","paper_date":"2021-08-12","code_links":[{"title":"henghuiding/Vision-Language-Transformer","url":"https://github.com/henghuiding/Vision-Language-Transformer"}],"metrics_order":"[\"gIoU\", \"cIoU\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":86267,"task":"Generalized Referring Expression Segmentation","parent_task":"Referring Expression Segmentation","dataset":"gRefCOCO","model_name":"MattNet","metrics":{"cIoU":"47.51","gIoU":"48.24"},"paper_url":"http://arxiv.org/abs/1801.08186v3","paper_title":"MAttNet: Modular Attention Network for Referring Expression Comprehension","paper_date":"2018-01-24","code_links":[{"title":"lichengunc/MAttNet","url":"https://github.com/lichengunc/MAttNet"}],"metrics_order":"[\"gIoU\", \"cIoU\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":106854,"task":"Generalized Referring Expression Segmentation","parent_task":"Referring Expression Segmentation","dataset":"gRefCOCO","model_name":"DeRIS-L","metrics":{"cIoU":"72.00","gIoU":"77.67"},"paper_url":"https://arxiv.org/abs/2507.01738v1","paper_title":"DeRIS: Decoupling Perception and Cognition for Enhanced Referring Image Segmentation through Loopback Synergy","paper_date":"2025-07-02","code_links":[{"title":"Dmmm1997/DeRIS","url":"https://github.com/Dmmm1997/DeRIS"}],"metrics_order":"[\"gIoU\", \"cIoU\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":106855,"task":"Generalized Referring Expression Segmentation","parent_task":"Referring Expression Segmentation","dataset":"gRefCOCO","model_name":"GSVA-Llama2-13B","metrics":{"cIoU":"66.38","gIoU":"70.04"},"paper_url":"https://arxiv.org/abs/2312.10103v3","paper_title":"GSVA: Generalized Segmentation via Multimodal Large Language Models","paper_date":"2023-12-15","code_links":[{"title":"leaplabthu/gsva","url":"https://github.com/leaplabthu/gsva"}],"metrics_order":"[\"gIoU\", \"cIoU\"]","area":"Computer Vision","uses_additional_data":1,"source":"archive","tags":[]},{"id":106856,"task":"Generalized Referring Expression Segmentation","parent_task":"Referring Expression Segmentation","dataset":"gRefCOCO","model_name":"MABP","metrics":{"cIoU":"65.69","gIoU":"68.79"},"paper_url":"https://arxiv.org/abs/2405.15169v2","paper_title":"Bring Adaptive Binding Prototypes to Generalized Referring Expression Segmentation","paper_date":"2024-05-24","code_links":[{"title":"buptlwz/mabp","url":"https://github.com/buptlwz/mabp"}],"metrics_order":"[\"gIoU\", \"cIoU\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":106857,"task":"Generalized Referring Expression Segmentation","parent_task":"Referring Expression Segmentation","dataset":"gRefCOCO","model_name":"HDC","metrics":{"cIoU":"65.42","gIoU":"68.28"},"paper_url":"https://arxiv.org/abs/2405.15658v2","paper_title":"CoHD: A Counting-Aware Hierarchical Decoding Framework for Generalized Referring Expression Segmentation","paper_date":"2024-05-24","code_links":[{"title":"robertluo1/cohd","url":"https://github.com/robertluo1/cohd"},{"title":"RobertLuo1/HDC","url":"https://github.com/RobertLuo1/HDC"}],"metrics_order":"[\"gIoU\", \"cIoU\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":106858,"task":"Generalized Referring Expression Segmentation","parent_task":"Referring Expression Segmentation","dataset":"gRefCOCO","model_name":"GSVA-Vicuna-13B-v1.1","metrics":{"cIoU":"64.05","gIoU":"68.01"},"paper_url":"https://arxiv.org/abs/2312.10103v3","paper_title":"GSVA: Generalized Segmentation via Multimodal Large Language Models","paper_date":"2023-12-15","code_links":[{"title":"leaplabthu/gsva","url":"https://github.com/leaplabthu/gsva"}],"metrics_order":"[\"gIoU\", \"cIoU\"]","area":"Computer Vision","uses_additional_data":1,"source":"archive","tags":[]},{"id":106859,"task":"Generalized Referring Expression Segmentation","parent_task":"Referring Expression Segmentation","dataset":"gRefCOCO","model_name":"GROUNDHOG","metrics":{"gIoU":"66.70"},"paper_url":"https://arxiv.org/abs/2402.16846v2","paper_title":"GROUNDHOG: Grounding Large Language Models to Holistic Segmentation","paper_date":"2024-02-26","code_links":[],"metrics_order":"[\"gIoU\", \"cIoU\"]","area":"Computer Vision","uses_additional_data":1,"source":"archive","tags":[]},{"id":106860,"task":"Generalized Referring Expression Segmentation","parent_task":"Referring Expression Segmentation","dataset":"gRefCOCO","model_name":"GSVA-Vicuna-7B-v1.1","metrics":{"cIoU":"63.29","gIoU":"66.47"},"paper_url":"https://arxiv.org/abs/2312.10103v3","paper_title":"GSVA: Generalized Segmentation via Multimodal Large Language Models","paper_date":"2023-12-15","code_links":[{"title":"leaplabthu/gsva","url":"https://github.com/leaplabthu/gsva"}],"metrics_order":"[\"gIoU\", \"cIoU\"]","area":"Computer Vision","uses_additional_data":1,"source":"archive","tags":[]},{"id":106861,"task":"Generalized Referring Expression Segmentation","parent_task":"Referring Expression Segmentation","dataset":"gRefCOCO","model_name":"ReLA","metrics":{"cIoU":"62.42","gIoU":"63.60"},"paper_url":"https://arxiv.org/abs/2306.00968v1","paper_title":"GRES: Generalized Referring Expression Segmentation","paper_date":"2023-06-01","code_links":[{"title":"henghuiding/ReLA","url":"https://github.com/henghuiding/ReLA"},{"title":"henghuiding/grefcoco","url":"https://github.com/henghuiding/grefcoco"}],"metrics_order":"[\"gIoU\", \"cIoU\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":106862,"task":"Generalized Referring Expression Segmentation","parent_task":"Referring Expression Segmentation","dataset":"gRefCOCO","model_name":"LAVT","metrics":{"cIoU":"57.64","gIoU":"58.40"},"paper_url":"https://arxiv.org/abs/2112.02244v2","paper_title":"LAVT: Language-Aware Vision Transformer for Referring Image Segmentation","paper_date":"2021-12-04","code_links":[{"title":"yz93/lavt-ris","url":"https://github.com/yz93/lavt-ris"}],"metrics_order":"[\"gIoU\", \"cIoU\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":106863,"task":"Generalized Referring Expression Segmentation","parent_task":"Referring Expression Segmentation","dataset":"gRefCOCO","model_name":"CRIS","metrics":{"cIoU":"55.34","gIoU":"56.27"},"paper_url":"https://arxiv.org/abs/2111.15174v2","paper_title":"CRIS: CLIP-Driven Referring Image Segmentation","paper_date":"2021-11-30","code_links":[{"title":"DerrickWang005/CRIS.pytorch","url":"https://github.com/DerrickWang005/CRIS.pytorch"}],"metrics_order":"[\"gIoU\", \"cIoU\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":106864,"task":"Generalized Referring Expression Segmentation","parent_task":"Referring Expression Segmentation","dataset":"gRefCOCO","model_name":"LTS","metrics":{"cIoU":"52.30","gIoU":"52.70"},"paper_url":"https://arxiv.org/abs/2103.16284v1","paper_title":"Locate then Segment: A Strong Pipeline for Referring Image Segmentation","paper_date":"2021-03-30","code_links":[],"metrics_order":"[\"gIoU\", \"cIoU\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":106865,"task":"Generalized Referring Expression Segmentation","parent_task":"Referring Expression Segmentation","dataset":"gRefCOCO","model_name":"VLT","metrics":{"cIoU":"52.51","gIoU":"52.00"},"paper_url":"https://arxiv.org/abs/2108.05565v1","paper_title":"Vision-Language Transformer and Query Generation for Referring Segmentation","paper_date":"2021-08-12","code_links":[{"title":"henghuiding/Vision-Language-Transformer","url":"https://github.com/henghuiding/Vision-Language-Transformer"}],"metrics_order":"[\"gIoU\", \"cIoU\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":106866,"task":"Generalized Referring Expression Segmentation","parent_task":"Referring Expression Segmentation","dataset":"gRefCOCO","model_name":"MattNet","metrics":{"cIoU":"47.51","gIoU":"48.24"},"paper_url":"http://arxiv.org/abs/1801.08186v3","paper_title":"MAttNet: Modular Attention Network for Referring Expression Comprehension","paper_date":"2018-01-24","code_links":[{"title":"lichengunc/MAttNet","url":"https://github.com/lichengunc/MAttNet"}],"metrics_order":"[\"gIoU\", \"cIoU\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]}]}