| Rank | Model |
PQ | PQst | PQth | RQ | SQ | RQst | RQth | SQst |
Extra Training Data |
Paper | Code | Year |
| 1 |
HyperSeg (Swin-B) |
61.2 | – | – | – | – | – | – | – |
✓ |
HyperSeg: Towards Universal Visual Segmentation with Large Language Model
|
congvvc/HyperSeg |
2024 |
| 2 |
OneFormer (InternImage-H,single-scale) |
60.0 | 49.2 | 67.1 | – | – | – | – | – |
|
OneFormer: One Transformer to Rule Universal Image Segmentation
|
huggingface/transformers · SHI-Labs/OneFormer · yangyucheng000/University
· +1 |
2022 |
| 3 |
OpenSeeD (SwinL, single-scale) |
59.5 | – | – | – | – | – | – | – |
✓ |
A Simple Framework for Open-Vocabulary Segmentation and Detection
|
microsoft/X-Decoder · idea-research/openseed |
2023 |
| 3 |
UMG-CLIP-E/14 |
59.5 | – | – | – | – | – | – | – |
✓ |
UMG-CLIP: A Unified Multi-Granularity Vision Generalist for Open-World Understanding
|
lygsbw/umg-clip |
2024 |
| 5 |
MasK DINO (SwinL,single-scale) |
59.4 | – | – | – | – | – | – | – |
✓ |
Mask DINO: Towards A Unified Transformer-based Framework for Object Detection and Segmentation
|
PaddlePaddle/PaddleDetection · IDEACVR/DINO · idea-research/maskdino
· +7 |
2022 |
| 6 |
EoMT (DINOv2-g, single-scale, 1280x1280) |
59.2 | – | – | – | – | – | – | – |
|
Your ViT is Secretly an Image Segmentation Model
|
tue-mps/eomt |
2025 |
| 7 |
UMG-CLIP-L/14 |
58.9 | – | – | – | – | – | – | – |
✓ |
UMG-CLIP: A Unified Multi-Granularity Vision Generalist for Open-World Understanding
|
lygsbw/umg-clip |
2024 |
| 8 |
DiNAT-L (single-scale, Mask2Former) |
58.5 | 48.8 | 64.9 | – | – | – | – | – |
|
Dilated Neighborhood Attention Transformer
|
huggingface/transformers · SHI-Labs/Neighborhood-Attention-Transformer · leondgarse/keras_cv_attention_models
· +4 |
2022 |
| 9 |
ViT-Adapter-L (single-scale, BEiTv2 pretrain, Mask2Former) |
58.4 | 48.4 | 65.0 | – | – | – | – | – |
|
Vision Transformer Adapter for Dense Predictions
|
czczup/vit-adapter · chenller/mmseg-extension |
2022 |
| 10 |
Visual Attention Network (VAN-B6 + Mask2Former) |
58.2 | 48.2 | 64.8 | – | – | – | – | – |
|
Visual Attention Network
|
huggingface/transformers · facebookresearch/xformers · PaddlePaddle/PaddleClas
· +18 |
2022 |
| 11 |
kMaX-DeepLab (single-scale, pseudo-labels) |
58.1 | 48.8 | 64.3 | – | – | – | – | – |
✓ |
kMaX-DeepLab: k-means Mask Transformer
|
google-research/deeplab2 · bytedance/kmax-deeplab · cy-xu/spatially_aware_ai |
2022 |
| 11 |
HIPIE (ViT-H, single-scale) |
58.1 | – | – | – | – | – | – | – |
✓ |
Hierarchical Open-vocabulary Universal Image Segmentation
|
berkeley-hipie/hipie |
2023 |
| 13 |
kMaX-DeepLab (single-scale, drop query with 256 queries) |
58.0 | 48.6 | 64.2 | – | – | – | – | – |
|
kMaX-DeepLab: k-means Mask Transformer
|
google-research/deeplab2 · bytedance/kmax-deeplab · cy-xu/spatially_aware_ai |
2022 |
| 13 |
OneFormer (DiNAT-L, single-scale) |
58.0 | 48.4 | 64.3 | – | – | – | – | – |
|
OneFormer: One Transformer to Rule Universal Image Segmentation
|
huggingface/transformers · SHI-Labs/OneFormer · yangyucheng000/University
· +1 |
2022 |
| 15 |
kMaX-DeepLab (single-scale) |
57.9 | 48.6 | 64.0 | – | – | – | – | – |
|
kMaX-DeepLab: k-means Mask Transformer
|
google-research/deeplab2 · bytedance/kmax-deeplab · cy-xu/spatially_aware_ai |
2022 |
| 15 |
OneFormer (Swin-L, single-scale) |
57.9 | 48.0 | 64.4 | – | – | – | – | – |
|
OneFormer: One Transformer to Rule Universal Image Segmentation
|
huggingface/transformers · SHI-Labs/OneFormer · yangyucheng000/University
· +1 |
2022 |
| 15 |
FocalNet-L (Mask2Former (200 queries)) |
57.9 | – | – | – | – | – | – | – |
|
Focal Modulation Networks
|
PaddlePaddle/PaddleDetection · keras-team/keras-io · microsoft/FocalNet
· +6 |
2022 |
| 18 |
Mask2Former (single-scale) |
57.8 | 48.1 | 64.2 | – | – | – | – | – |
|
Masked-attention Mask Transformer for Universal Image Segmentation
|
huggingface/transformers · open-mmlab/mmdetection · facebookresearch/Mask2Former
· +4 |
2021 |
| 19 |
Panoptic SegFormer (single-scale) |
55.8 | 46.9 | 61.7 | – | – | – | – | – |
|
Panoptic SegFormer: Delving Deeper into Panoptic Segmentation with Transformers
|
zhiqi-li/Panoptic-SegFormer · claud1234/clft · claud1234/fcn_transformer_object_segmentation |
2021 |
| 20 |
CMT-DeepLab (single-scale) |
55.3 | 46.6 | 61.0 | – | – | – | – | – |
|
CMT-DeepLab: Clustering Mask Transformers for Panoptic Segmentation
|
bytedance/kmax-deeplab · 2024-MindSpore-1/Code7 |
2022 |