| Rank | Model |
mask AP | AP50 | AP |
Extra Training Data |
Paper | Code | Year |
| 1 |
ViT-P (OneFormer, ConvNeXt-L, single-scale, 512x1024, Mapillary Vistas-pretrained) |
49.0 | – | 49.0 |
✓ |
The Missing Point in Vision Transformers for Universal Image Segmentation
|
sajjad-sh33/vit-p |
2025 |
| 2 |
OneFormer (ConvNeXt-L, single-scale, Mapillary-Pretrained) |
48.7 | – | – |
✓ |
OneFormer: One Transformer to Rule Universal Image Segmentation
|
huggingface/transformers · SHI-Labs/OneFormer · yangyucheng000/University
· +1 |
2022 |
| 3 |
OpenSeeD( SwinL, single-scale) |
48.5 | – | – |
✓ |
A Simple Framework for Open-Vocabulary Segmentation and Detection
|
microsoft/X-Decoder · idea-research/openseed |
2023 |
| 4 |
AFF-Base (single-scale, point-based Mask2Former) |
46.2 | 74.2 | – |
|
AutoFocusFormer: Image Segmentation off the Grid
|
apple/ml-autofocusformer |
2023 |
| 5 |
OneFormer (DiNAT-L, single-scale) |
45.6 | – | – |
|
OneFormer: One Transformer to Rule Universal Image Segmentation
|
huggingface/transformers · SHI-Labs/OneFormer · yangyucheng000/University
· +1 |
2022 |
| 5 |
OneFormer (Swin-L, single-scale) |
45.6 | – | – |
|
OneFormer: One Transformer to Rule Universal Image Segmentation
|
huggingface/transformers · SHI-Labs/OneFormer · yangyucheng000/University
· +1 |
2022 |
| 7 |
DiNAT-L (single-scale, Mask2Former) |
45.1 | 72.6 | – |
|
Dilated Neighborhood Attention Transformer
|
huggingface/transformers · SHI-Labs/Neighborhood-Attention-Transformer · leondgarse/keras_cv_attention_models
· +4 |
2022 |
| 8 |
AFF-Small (single-scale, point-based Mask2Former) |
44.0 | 72.8 | – |
|
AutoFocusFormer: Image Segmentation off the Grid
|
apple/ml-autofocusformer |
2023 |
| 9 |
Mask2Former (Swin-L, single-scale) |
43.7 | – | – |
|
Masked-attention Mask Transformer for Universal Image Segmentation
|
huggingface/transformers · open-mmlab/mmdetection · facebookresearch/Mask2Former
· +4 |
2021 |
| 10 |
Mask2Former (Swin-B) |
42 | – | – |
|
Masked-attention Mask Transformer for Universal Image Segmentation
|
huggingface/transformers · open-mmlab/mmdetection · facebookresearch/Mask2Former
· +4 |
2021 |
| 11 |
Mask2Former (Swin-S) |
41.8 | – | – |
|
Masked-attention Mask Transformer for Universal Image Segmentation
|
huggingface/transformers · open-mmlab/mmdetection · facebookresearch/Mask2Former
· +4 |
2021 |
| 12 |
PolySnake |
40.2 | – | – |
|
Recurrent Generic Contour-based Instance Segmentation with Progressive Learning
|
fh2019ustc/polysnake |
2023 |
| 13 |
Mask2Former (Swin-T) |
39.7 | – | – |
|
Masked-attention Mask Transformer for Universal Image Segmentation
|
huggingface/transformers · open-mmlab/mmdetection · facebookresearch/Mask2Former
· +4 |
2021 |
| 14 |
Mask2Former (ResNet-101) |
38.5 | – | – |
|
Masked-attention Mask Transformer for Universal Image Segmentation
|
huggingface/transformers · open-mmlab/mmdetection · facebookresearch/Mask2Former
· +4 |
2021 |
| 15 |
Mask2Former (ResNet-50) |
37.4 | – | – |
|
Masked-attention Mask Transformer for Universal Image Segmentation
|
huggingface/transformers · open-mmlab/mmdetection · facebookresearch/Mask2Former
· +4 |
2021 |
| 16 |
GAIS-Net |
37.1 | – | – |
✓ |
Geometry-Aware Instance Segmentation with Disparity Maps
|
choyingw/GAIS-Net |
2020 |
| 17 |
PointRend |
35.8 | – | – |
|
PointRend: Image Segmentation as Rendering
|
facebookresearch/detectron2 · open-mmlab/mmdetection · open-mmlab/mmsegmentation
· +11 |
2019 |