paper-with-me

Panoptic Segmentation 벤치마크

Panoptic Segmentation on COCO minival

93개 결과 · ⬇ CSV · JSON

PQ

43.4 47.85 52.3 56.75 61.2 2020-03 2026-09 Axial-DeepLab-L (multi-scale) — 43.9 (2020-03-17) Axial-DeepLab-L (single-scale) — 43.4 (2020-03-17) Axial-DeepLab-L (multi-scale) — 43.9 (2020-03-17) Axial-DeepLab-L (single-scale) — 43.4 (2020-03-17) Axial-DeepLab-L (multi-scale) — 43.9 (2020-03-17) Axial-DeepLab-L (single-scale) — 43.4 (2020-03-17) PanopticFPN+ResNeSt(single-scale) — 47.9 (2020-04-19) PanopticFPN+ResNeSt(single-scale) — 47.9 (2020-04-19) PanopticFPN+ResNeSt(single-scale) — 47.9 (2020-04-19) DETR-R101 (ResNet-101) — 45.1 (2020-05-26) PanopticFPN++ — 44.1 (2020-05-26) DETR-R101 (ResNet-101) — 45.1 (2020-05-26) PanopticFPN++ — 44.1 (2020-05-26) DETR-R101 (ResNet-101) — 45.1 (2020-05-26) PanopticFPN++ — 44.1 (2020-05-26) MaX-DeepLab-L (single-scale) — 51.1 (2020-12-01) Panoptic FCN* (ResNet-50-FPN) — 44.3 (2020-12-01) MaX-DeepLab-L (single-scale) — 51.1 (2020-12-01) Panoptic FCN* (ResNet-50-FPN) — 44.3 (2020-12-01) MaX-DeepLab-L (single-scale) — 51.1 (2020-12-01) Panoptic FCN* (ResNet-50-FPN) — 44.3 (2020-12-01) MaskFormer (single-scale) — 52.7 (2021-07-13) MaskFormer (single-scale) — 52.7 (2021-07-13) MaskFormer (single-scale) — 52.7 (2021-07-13) Panoptic SegFormer (single-scale) — 55.8 (2021-09-08) Panoptic SegFormer (ResNet-101) — 50.6 (2021-09-08) Panoptic SegFormer (single-scale) — 55.8 (2021-09-08) Panoptic SegFormer (ResNet-101) — 50.6 (2021-09-08) Panoptic SegFormer (single-scale) — 55.8 (2021-09-08) Panoptic SegFormer (ResNet-101) — 50.6 (2021-09-08) Mask2Former (single-scale) — 57.8 (2021-12-02) Mask2Former (single-scale) — 57.8 (2021-12-02) Mask2Former (single-scale) — 57.8 (2021-12-02) Visual Attention Network (VAN-B6 + Mask2Former) — 58.2 (2022-02-20) Visual Attention Network (VAN-B6 + Mask2Former) — 58.2 (2022-02-20) Visual Attention Network (VAN-B6 + Mask2Former) — 58.2 (2022-02-20) FocalNet-L (Mask2Former (200 queries)) — 57.9 (2022-03-22) FocalNet-L (Mask2Former (200 queries)) — 57.9 (2022-03-22) FocalNet-L (Mask2Former (200 queries)) — 57.9 (2022-03-22) ViT-Adapter-L (single-scale, BEiTv2 pretrain, Mask2Former) — 58.4 (2022-05-17) ViT-Adapter-L (single-scale, BEiTv2 pretrain, Mask2Former) — 58.4 (2022-05-17) ViT-Adapter-L (single-scale, BEiTv2 pretrain, Mask2Former) — 58.4 (2022-05-17) MasK DINO (SwinL,single-scale) — 59.4 (2022-06-06) MasK DINO (SwinL,single-scale) — 59.4 (2022-06-06) MasK DINO (SwinL,single-scale) — 59.4 (2022-06-06) CMT-DeepLab (single-scale) — 55.3 (2022-06-17) CMT-DeepLab (single-scale) — 55.3 (2022-06-17) CMT-DeepLab (single-scale) — 55.3 (2022-06-17) kMaX-DeepLab (single-scale, pseudo-labels) — 58.1 (2022-07-08) kMaX-DeepLab (single-scale, drop query with 256 queries) — 58.0 (2022-07-08) kMaX-DeepLab (single-scale) — 57.9 (2022-07-08) kMaX-DeepLab (single-scale, pseudo-labels) — 58.1 (2022-07-08) kMaX-DeepLab (single-scale, drop query with 256 queries) — 58.0 (2022-07-08) kMaX-DeepLab (single-scale) — 57.9 (2022-07-08) kMaX-DeepLab (single-scale, pseudo-labels) — 58.1 (2022-07-08) kMaX-DeepLab (single-scale, drop query with 256 queries) — 58.0 (2022-07-08) kMaX-DeepLab (single-scale) — 57.9 (2022-07-08) DiNAT-L (single-scale, Mask2Former) — 58.5 (2022-09-29) DiNAT-L (single-scale, Mask2Former) — 58.5 (2022-09-29) DiNAT-L (single-scale, Mask2Former) — 58.5 (2022-09-29) OneFormer (InternImage-H,single-scale) — 60.0 (2022-11-10) OneFormer (DiNAT-L, single-scale) — 58.0 (2022-11-10) OneFormer (Swin-L, single-scale) — 57.9 (2022-11-10) OneFormer (InternImage-H,single-scale) — 60.0 (2022-11-10) OneFormer (DiNAT-L, single-scale) — 58.0 (2022-11-10) OneFormer (Swin-L, single-scale) — 57.9 (2022-11-10) OneFormer (InternImage-H,single-scale) — 60.0 (2022-11-10) OneFormer (DiNAT-L, single-scale) — 58.0 (2022-11-10) OneFormer (Swin-L, single-scale) — 57.9 (2022-11-10) OpenSeeD (SwinL, single-scale) — 59.5 (2023-03-14) OpenSeeD (SwinL, single-scale) — 59.5 (2023-03-14) OpenSeeD (SwinL, single-scale) — 59.5 (2023-03-14) HIPIE (ViT-H, single-scale) — 58.1 (2023-07-03) HIPIE (ViT-H, single-scale) — 58.1 (2023-07-03) HIPIE (ViT-H, single-scale) — 58.1 (2023-07-03) UMG-CLIP-E/14 — 59.5 (2024-01-12) UMG-CLIP-L/14 — 58.9 (2024-01-12) UMG-CLIP-E/14 — 59.5 (2024-01-12) UMG-CLIP-L/14 — 58.9 (2024-01-12) UMG-CLIP-E/14 — 59.5 (2024-01-12) UMG-CLIP-L/14 — 58.9 (2024-01-12) HyperSeg (Swin-B) — 61.2 (2024-11-26) HyperSeg (Swin-B) — 61.2 (2024-11-26) HyperSeg (Swin-B) — 61.2 (2024-11-26) EoMT (DINOv2-g, single-scale, 1280x1280) — 59.2 (2025-03-24) EoMT (DINOv2-g, single-scale, 1280x1280) — 59.2 (2025-03-24) EoMT (DINOv2-g, single-scale, 1280x1280) — 59.2 (2025-03-24) Axial-DeepLab-L (multi-scale) — 43.9 (2020-03-17) PanopticFPN+ResNeSt(single-scale) — 47.9 (2020-04-19) MaX-DeepLab-L (single-scale) — 51.1 (2020-12-01) MaskFormer (single-scale) — 52.7 (2021-07-13) Panoptic SegFormer (single-scale) — 55.8 (2021-09-08) Mask2Former (single-scale) — 57.8 (2021-12-02) Visual Attention Network (VAN-B6 + Mask2Former) — 58.2 (2022-02-20) ViT-Adapter-L (single-scale, BEiTv2 pretrain, Mask2Former) — 58.4 (2022-05-17) MasK DINO (SwinL,single-scale) — 59.4 (2022-06-06) OneFormer (InternImage-H,single-scale) — 60.0 (2022-11-10) HyperSeg (Swin-B) — 61.2 (2024-11-26)
RankModel PQPQstPQthRQSQRQstRQthSQst Extra Training Data PaperCodeYear
1 HyperSeg (Swin-B) 61.2 HyperSeg: Towards Universal Visual Segmentation with Large Language Model congvvc/HyperSeg 2024
2 OneFormer (InternImage-H,single-scale) 60.049.267.1 OneFormer: One Transformer to Rule Universal Image Segmentation huggingface/transformers · SHI-Labs/OneFormer · yangyucheng000/University · +1 2022
3 OpenSeeD (SwinL, single-scale) 59.5 A Simple Framework for Open-Vocabulary Segmentation and Detection microsoft/X-Decoder · idea-research/openseed 2023
3 UMG-CLIP-E/14 59.5 UMG-CLIP: A Unified Multi-Granularity Vision Generalist for Open-World Understanding lygsbw/umg-clip 2024
5 MasK DINO (SwinL,single-scale) 59.4 Mask DINO: Towards A Unified Transformer-based Framework for Object Detection and Segmentation PaddlePaddle/PaddleDetection · IDEACVR/DINO · idea-research/maskdino · +7 2022
6 EoMT (DINOv2-g, single-scale, 1280x1280) 59.2 Your ViT is Secretly an Image Segmentation Model tue-mps/eomt 2025
7 UMG-CLIP-L/14 58.9 UMG-CLIP: A Unified Multi-Granularity Vision Generalist for Open-World Understanding lygsbw/umg-clip 2024
8 DiNAT-L (single-scale, Mask2Former) 58.548.864.9 Dilated Neighborhood Attention Transformer huggingface/transformers · SHI-Labs/Neighborhood-Attention-Transformer · leondgarse/keras_cv_attention_models · +4 2022
9 ViT-Adapter-L (single-scale, BEiTv2 pretrain, Mask2Former) 58.448.465.0 Vision Transformer Adapter for Dense Predictions czczup/vit-adapter · chenller/mmseg-extension 2022
10 Visual Attention Network (VAN-B6 + Mask2Former) 58.248.264.8 Visual Attention Network huggingface/transformers · facebookresearch/xformers · PaddlePaddle/PaddleClas · +18 2022
11 kMaX-DeepLab (single-scale, pseudo-labels) 58.148.864.3 kMaX-DeepLab: k-means Mask Transformer google-research/deeplab2 · bytedance/kmax-deeplab · cy-xu/spatially_aware_ai 2022
11 HIPIE (ViT-H, single-scale) 58.1 Hierarchical Open-vocabulary Universal Image Segmentation berkeley-hipie/hipie 2023
13 kMaX-DeepLab (single-scale, drop query with 256 queries) 58.048.664.2 kMaX-DeepLab: k-means Mask Transformer google-research/deeplab2 · bytedance/kmax-deeplab · cy-xu/spatially_aware_ai 2022
13 OneFormer (DiNAT-L, single-scale) 58.048.464.3 OneFormer: One Transformer to Rule Universal Image Segmentation huggingface/transformers · SHI-Labs/OneFormer · yangyucheng000/University · +1 2022
15 kMaX-DeepLab (single-scale) 57.948.664.0 kMaX-DeepLab: k-means Mask Transformer google-research/deeplab2 · bytedance/kmax-deeplab · cy-xu/spatially_aware_ai 2022
15 OneFormer (Swin-L, single-scale) 57.948.064.4 OneFormer: One Transformer to Rule Universal Image Segmentation huggingface/transformers · SHI-Labs/OneFormer · yangyucheng000/University · +1 2022
15 FocalNet-L (Mask2Former (200 queries)) 57.9 Focal Modulation Networks PaddlePaddle/PaddleDetection · keras-team/keras-io · microsoft/FocalNet · +6 2022
18 Mask2Former (single-scale) 57.848.164.2 Masked-attention Mask Transformer for Universal Image Segmentation huggingface/transformers · open-mmlab/mmdetection · facebookresearch/Mask2Former · +4 2021
19 Panoptic SegFormer (single-scale) 55.846.961.7 Panoptic SegFormer: Delving Deeper into Panoptic Segmentation with Transformers zhiqi-li/Panoptic-SegFormer · claud1234/clft · claud1234/fcn_transformer_object_segmentation 2021
20 CMT-DeepLab (single-scale) 55.346.661.0 CMT-DeepLab: Clustering Mask Transformers for Panoptic Segmentation bytedance/kmax-deeplab · 2024-MindSpore-1/Code7 2022
1–20 / 93 다음 → 페이지당 10 20 50 100