| Rank | Model |
AP | AP50 | AP75 | APL | APM | APS | Param. |
Extra Training Data |
Paper | Code | Year |
| 1 |
Mr. DETR (Swin-L, 1x, 5cale) |
61.8 | 79.0 | 67.6 | 75.7 | 65.6 | 47.7 | – |
✓ |
Mr. DETR: Instructive Multi-Route Training for Detection Transformers
|
Visual-AI/Mr.DETR |
2024 |
| 2 |
Mr. DETR (Swin-L, 1x, 4scale) |
58.4 | 76.3 | 63.9 | 75.3 | 62.8 | 40.8 | – |
|
Mr. DETR: Instructive Multi-Route Training for Detection Transformers
|
Visual-AI/Mr.DETR |
2024 |
| 3 |
MI-DETR (Swin-L 1x) |
58.2 | 76.5 | 63.4 | 74.6 | 62.8 | 42.5 | – |
|
MI-DETR: An Object Detection Model with Multi-time Inquiries Mechanism
|
CQU-ADHRI-Lab/MI-DETR |
2025 |
| 4 |
Relation-DETR (Swin-L 2x) |
58.1 | 76.4 | 63.5 | 73.5 | 63.0 | 41.8 | – |
|
Relation DETR: Exploring Explicit Position Relation Prior for Object Detection
|
xiuqhou/relation-detr · xiuqhou/Salience-DETR |
2024 |
| 5 |
Relation-DETR (Swin-L 1x) |
57.8 | 76.1 | 62.9 | 74.4 | 62.1 | 41.2 | – |
|
Relation DETR: Exploring Explicit Position Relation Prior for Object Detection
|
xiuqhou/relation-detr · xiuqhou/Salience-DETR |
2024 |
| 6 |
Salience-DETR (Focal-L 1x) |
57.3 | 75.5 | 62.3 | 74.5 | 61.8 | 40.9 | 220M |
|
Salience DETR: Enhancing Detection Transformer with Hierarchical Salience Filtering Refinement
|
xiuqhou/relation-detr · xiuqhou/Salience-DETR · xunull/read-Salience-DETR |
2024 |
| 7 |
YOLOv6-L6(46 fps, V100, bs1) |
57.2 | 74.5 | – | – | – | – | – |
|
YOLOv6 v3.0: A Full-Scale Reloading
|
PaddlePaddle/PaddleDetection · meituan/yolov6 · PaddlePaddle/PaddleYOLO
· +2 |
2023 |
| 8 |
Salience-DETR (Swin-L 1x) |
56.5 | 75.0 | 61.5 | 72.8 | 61.2 | 40.2 | 210M |
|
Salience DETR: Enhancing Detection Transformer with Hierarchical Salience Filtering Refinement
|
xiuqhou/relation-detr · xiuqhou/Salience-DETR · xunull/read-Salience-DETR |
2024 |
| 9 |
MogaNet-XL (Cascade Mask R-CNN) |
56.2 | – | – | – | – | – | – |
|
MogaNet: Multi-order Gated Aggregation Network
|
chengtan9907/OpenSTL · chengtan9907/simvpv2 · Westlake-AI/openmixup
· +4 |
2022 |
| 10 |
MogaNet-L (Cascade Mask R-CNN) |
53.3 | – | – | – | – | – | – |
|
MogaNet: Multi-order Gated Aggregation Network
|
chengtan9907/OpenSTL · chengtan9907/simvpv2 · Westlake-AI/openmixup
· +4 |
2022 |
| 11 |
MogaNet-B (Cascade Mask R-CNN) |
52.6 | – | – | – | – | – | – |
|
MogaNet: Multi-order Gated Aggregation Network
|
chengtan9907/OpenSTL · chengtan9907/simvpv2 · Westlake-AI/openmixup
· +4 |
2022 |
| 12 |
Relation-DETR (ResNet50 2x) |
52.1 | 69.7 | 56.6 | 66.5 | 56.0 | 36.1 | – |
|
Relation DETR: Exploring Explicit Position Relation Prior for Object Detection
|
xiuqhou/relation-detr · xiuqhou/Salience-DETR |
2024 |
| 13 |
Relation-DETR (ResNet50 1x) |
51.7 | 69.1 | 56.3 | 66.1 | 55.6 | 36.1 | – |
|
Relation DETR: Exploring Explicit Position Relation Prior for Object Detection
|
xiuqhou/relation-detr · xiuqhou/Salience-DETR |
2024 |
| 14 |
MogaNet-S (Cascade Mask R-CNN) |
51.6 | – | – | – | – | – | – |
|
MogaNet: Multi-order Gated Aggregation Network
|
chengtan9907/OpenSTL · chengtan9907/simvpv2 · Westlake-AI/openmixup
· +4 |
2022 |
| 15 |
RF-ConvNeXt-T Cascade R-CNN |
50.9 | – | – | – | – | – | – |
|
RF-Next: Efficient Receptive Field Search for Convolutional Neural Networks
|
ShangHua-Gao/G2L-search · ShangHua-Gao/RFNext |
2022 |
| 16 |
Salience-DETR (ResNet50 1x) |
50.0 | 67.7 | 54.2 | 64.4 | 54.4 | 33.3 | 56M |
|
Salience DETR: Enhancing Detection Transformer with Hierarchical Salience Filtering Refinement
|
xiuqhou/relation-detr · xiuqhou/Salience-DETR · xunull/read-Salience-DETR |
2024 |
| 17 |
SQR-Adamixer-R101 |
49.8 | – | – | – | – | – | – |
|
Enhanced Training of Query-Based Object Detection via Selective Query Recollection
|
IDEA-Research/detrex · fangyi-chen/sqr |
2022 |
| 18 |
MogaNet-L (Mask R-CNN 1x) |
49.4 | – | – | – | – | – | – |
|
MogaNet: Multi-order Gated Aggregation Network
|
chengtan9907/OpenSTL · chengtan9907/simvpv2 · Westlake-AI/openmixup
· +4 |
2022 |
| 19 |
ViDT Swin-base |
49.2 | 69.4 | 53.1 | 66.9 | 52.6 | 30.6 | 0.1B |
|
ViDT: An Efficient and Effective Fully Transformer-based Object Detector
|
naver-ai/vidt |
2021 |
| 20 |
SQR-Adamixer-R50 |
48.9 | – | – | – | – | – | – |
|
Enhanced Training of Query-Based Object Detection via Selective Query Recollection
|
IDEA-Research/detrex · fangyi-chen/sqr |
2022 |
| 21 |
MogaNet-L (RetinaNet 1x) |
48.7 | – | – | – | – | – | – |
|
MogaNet: Multi-order Gated Aggregation Network
|
chengtan9907/OpenSTL · chengtan9907/simvpv2 · Westlake-AI/openmixup
· +4 |
2022 |
| 22 |
MogaNet-B (Mask R-CNN 1x) |
47.9 | – | – | – | – | – | – |
|
MogaNet: Multi-order Gated Aggregation Network
|
chengtan9907/OpenSTL · chengtan9907/simvpv2 · Westlake-AI/openmixup
· +4 |
2022 |
| 23 |
MogaNet-B (RetinaNet 1x) |
47.7 | – | – | – | – | – | – |
|
MogaNet: Multi-order Gated Aggregation Network
|
chengtan9907/OpenSTL · chengtan9907/simvpv2 · Westlake-AI/openmixup
· +4 |
2022 |
| 24 |
ViDT Swin-small |
47.5 | 67.7 | 51.4 | 64.8 | 50.7 | 29.2 | 61M |
|
ViDT: An Efficient and Effective Fully Transformer-based Object Detector
|
naver-ai/vidt |
2021 |
| 25 |
MogaNet-S (Mask R-CNN 1x) |
46.7 | – | – | – | – | – | – |
|
MogaNet: Multi-order Gated Aggregation Network
|
chengtan9907/OpenSTL · chengtan9907/simvpv2 · Westlake-AI/openmixup
· +4 |
2022 |
| 26 |
MogaNet-S (RetinaNet 1x) |
45.8 | – | – | – | – | – | – |
|
MogaNet: Multi-order Gated Aggregation Network
|
chengtan9907/OpenSTL · chengtan9907/simvpv2 · Westlake-AI/openmixup
· +4 |
2022 |
| 27 |
ViDT Swin-tiny |
44.8 | 64.5 | 48.7 | 62.1 | 47.6 | 25.9 | 38M |
|
ViDT: An Efficient and Effective Fully Transformer-based Object Detector
|
naver-ai/vidt |
2021 |
| 28 |
MogaNet-T (Mask R-CNN 1x) |
42.6 | – | – | – | – | – | – |
|
MogaNet: Multi-order Gated Aggregation Network
|
chengtan9907/OpenSTL · chengtan9907/simvpv2 · Westlake-AI/openmixup
· +4 |
2022 |
| 29 |
MogaNet-T (RetinaNet 1x) |
41.4 | – | – | – | – | – | – |
|
MogaNet: Multi-order Gated Aggregation Network
|
chengtan9907/OpenSTL · chengtan9907/simvpv2 · Westlake-AI/openmixup
· +4 |
2022 |
| 30 |
MogaNet-XT (Mask R-CNN 1x) |
40.7 | – | – | – | – | – | – |
|
MogaNet: Multi-order Gated Aggregation Network
|
chengtan9907/OpenSTL · chengtan9907/simvpv2 · Westlake-AI/openmixup
· +4 |
2022 |
| 31 |
ViDT Swin-nano |
40.4 | 59.6 | 43.3 | 55.8 | 42.5 | 23.2 | 16M |
|
ViDT: An Efficient and Effective Fully Transformer-based Object Detector
|
naver-ai/vidt |
2021 |
| 32 |
MogaNet-XT (RetinaNet 1x) |
39.7 | – | – | – | – | – | – |
|
MogaNet: Multi-order Gated Aggregation Network
|
chengtan9907/OpenSTL · chengtan9907/simvpv2 · Westlake-AI/openmixup
· +4 |
2022 |
| 33 |
DyHead (Swin-T, multi scale) |
– | 68 | 54.3 | 64.2 | – | – | – |
|
Dynamic Head: Unifying Object Detection Heads with Attentions
|
open-mmlab/mmdetection · microsoft/DynamicHead · Coldestadam/DynamicHead |
2021 |
| 34 |
Mr. DETR (Swin-L, 1x, 5cale) |
61.8 | 79.0 | 67.6 | 75.7 | 65.6 | 47.7 | – |
✓ |
Mr. DETR: Instructive Multi-Route Training for Detection Transformers
|
Visual-AI/Mr.DETR |
2024 |
| 35 |
Mr. DETR (Swin-L, 1x, 4scale) |
58.4 | 76.3 | 63.9 | 75.3 | 62.8 | 40.8 | – |
|
Mr. DETR: Instructive Multi-Route Training for Detection Transformers
|
Visual-AI/Mr.DETR |
2024 |
| 36 |
MI-DETR (Swin-L 1x) |
58.2 | 76.5 | 63.4 | 74.6 | 62.8 | 42.5 | – |
|
MI-DETR: An Object Detection Model with Multi-time Inquiries Mechanism
|
CQU-ADHRI-Lab/MI-DETR |
2025 |
| 37 |
Relation-DETR (Swin-L 2x) |
58.1 | 76.4 | 63.5 | 73.5 | 63.0 | 41.8 | – |
|
Relation DETR: Exploring Explicit Position Relation Prior for Object Detection
|
xiuqhou/relation-detr · xiuqhou/Salience-DETR |
2024 |
| 38 |
Relation-DETR (Swin-L 1x) |
57.8 | 76.1 | 62.9 | 74.4 | 62.1 | 41.2 | – |
|
Relation DETR: Exploring Explicit Position Relation Prior for Object Detection
|
xiuqhou/relation-detr · xiuqhou/Salience-DETR |
2024 |
| 39 |
Salience-DETR (Focal-L 1x) |
57.3 | 75.5 | 62.3 | 74.5 | 61.8 | 40.9 | 220M |
|
Salience DETR: Enhancing Detection Transformer with Hierarchical Salience Filtering Refinement
|
xiuqhou/relation-detr · xiuqhou/Salience-DETR · xunull/read-Salience-DETR |
2024 |
| 40 |
YOLOv6-L6(46 fps, V100, bs1) |
57.2 | 74.5 | – | – | – | – | – |
|
YOLOv6 v3.0: A Full-Scale Reloading
|
PaddlePaddle/PaddleDetection · meituan/yolov6 · PaddlePaddle/PaddleYOLO
· +2 |
2023 |
| 41 |
Salience-DETR (Swin-L 1x) |
56.5 | 75.0 | 61.5 | 72.8 | 61.2 | 40.2 | 210M |
|
Salience DETR: Enhancing Detection Transformer with Hierarchical Salience Filtering Refinement
|
xiuqhou/relation-detr · xiuqhou/Salience-DETR · xunull/read-Salience-DETR |
2024 |
| 42 |
MogaNet-XL (Cascade Mask R-CNN) |
56.2 | – | – | – | – | – | – |
|
MogaNet: Multi-order Gated Aggregation Network
|
chengtan9907/OpenSTL · chengtan9907/simvpv2 · Westlake-AI/openmixup
· +4 |
2022 |
| 43 |
MogaNet-L (Cascade Mask R-CNN) |
53.3 | – | – | – | – | – | – |
|
MogaNet: Multi-order Gated Aggregation Network
|
chengtan9907/OpenSTL · chengtan9907/simvpv2 · Westlake-AI/openmixup
· +4 |
2022 |
| 44 |
MogaNet-B (Cascade Mask R-CNN) |
52.6 | – | – | – | – | – | – |
|
MogaNet: Multi-order Gated Aggregation Network
|
chengtan9907/OpenSTL · chengtan9907/simvpv2 · Westlake-AI/openmixup
· +4 |
2022 |
| 45 |
Relation-DETR (ResNet50 2x) |
52.1 | 69.7 | 56.6 | 66.5 | 56.0 | 36.1 | – |
|
Relation DETR: Exploring Explicit Position Relation Prior for Object Detection
|
xiuqhou/relation-detr · xiuqhou/Salience-DETR |
2024 |
| 46 |
Relation-DETR (ResNet50 1x) |
51.7 | 69.1 | 56.3 | 66.1 | 55.6 | 36.1 | – |
|
Relation DETR: Exploring Explicit Position Relation Prior for Object Detection
|
xiuqhou/relation-detr · xiuqhou/Salience-DETR |
2024 |
| 47 |
MogaNet-S (Cascade Mask R-CNN) |
51.6 | – | – | – | – | – | – |
|
MogaNet: Multi-order Gated Aggregation Network
|
chengtan9907/OpenSTL · chengtan9907/simvpv2 · Westlake-AI/openmixup
· +4 |
2022 |
| 48 |
RF-ConvNeXt-T Cascade R-CNN |
50.9 | – | – | – | – | – | – |
|
RF-Next: Efficient Receptive Field Search for Convolutional Neural Networks
|
ShangHua-Gao/G2L-search · ShangHua-Gao/RFNext |
2022 |
| 49 |
Salience-DETR (ResNet50 1x) |
50.0 | 67.7 | 54.2 | 64.4 | 54.4 | 33.3 | 56M |
|
Salience DETR: Enhancing Detection Transformer with Hierarchical Salience Filtering Refinement
|
xiuqhou/relation-detr · xiuqhou/Salience-DETR · xunull/read-Salience-DETR |
2024 |
| 50 |
SQR-Adamixer-R101 |
49.8 | – | – | – | – | – | – |
|
Enhanced Training of Query-Based Object Detection via Selective Query Recollection
|
IDEA-Research/detrex · fangyi-chen/sqr |
2022 |
| 51 |
MogaNet-L (Mask R-CNN 1x) |
49.4 | – | – | – | – | – | – |
|
MogaNet: Multi-order Gated Aggregation Network
|
chengtan9907/OpenSTL · chengtan9907/simvpv2 · Westlake-AI/openmixup
· +4 |
2022 |
| 52 |
ViDT Swin-base |
49.2 | 69.4 | 53.1 | 66.9 | 52.6 | 30.6 | 0.1B |
|
ViDT: An Efficient and Effective Fully Transformer-based Object Detector
|
naver-ai/vidt |
2021 |
| 53 |
SQR-Adamixer-R50 |
48.9 | – | – | – | – | – | – |
|
Enhanced Training of Query-Based Object Detection via Selective Query Recollection
|
IDEA-Research/detrex · fangyi-chen/sqr |
2022 |
| 54 |
MogaNet-L (RetinaNet 1x) |
48.7 | – | – | – | – | – | – |
|
MogaNet: Multi-order Gated Aggregation Network
|
chengtan9907/OpenSTL · chengtan9907/simvpv2 · Westlake-AI/openmixup
· +4 |
2022 |
| 55 |
MogaNet-B (Mask R-CNN 1x) |
47.9 | – | – | – | – | – | – |
|
MogaNet: Multi-order Gated Aggregation Network
|
chengtan9907/OpenSTL · chengtan9907/simvpv2 · Westlake-AI/openmixup
· +4 |
2022 |
| 56 |
MogaNet-B (RetinaNet 1x) |
47.7 | – | – | – | – | – | – |
|
MogaNet: Multi-order Gated Aggregation Network
|
chengtan9907/OpenSTL · chengtan9907/simvpv2 · Westlake-AI/openmixup
· +4 |
2022 |
| 57 |
ViDT Swin-small |
47.5 | 67.7 | 51.4 | 64.8 | 50.7 | 29.2 | 61M |
|
ViDT: An Efficient and Effective Fully Transformer-based Object Detector
|
naver-ai/vidt |
2021 |
| 58 |
MogaNet-S (Mask R-CNN 1x) |
46.7 | – | – | – | – | – | – |
|
MogaNet: Multi-order Gated Aggregation Network
|
chengtan9907/OpenSTL · chengtan9907/simvpv2 · Westlake-AI/openmixup
· +4 |
2022 |
| 59 |
MogaNet-S (RetinaNet 1x) |
45.8 | – | – | – | – | – | – |
|
MogaNet: Multi-order Gated Aggregation Network
|
chengtan9907/OpenSTL · chengtan9907/simvpv2 · Westlake-AI/openmixup
· +4 |
2022 |
| 60 |
ViDT Swin-tiny |
44.8 | 64.5 | 48.7 | 62.1 | 47.6 | 25.9 | 38M |
|
ViDT: An Efficient and Effective Fully Transformer-based Object Detector
|
naver-ai/vidt |
2021 |
| 61 |
MogaNet-T (Mask R-CNN 1x) |
42.6 | – | – | – | – | – | – |
|
MogaNet: Multi-order Gated Aggregation Network
|
chengtan9907/OpenSTL · chengtan9907/simvpv2 · Westlake-AI/openmixup
· +4 |
2022 |
| 62 |
MogaNet-T (RetinaNet 1x) |
41.4 | – | – | – | – | – | – |
|
MogaNet: Multi-order Gated Aggregation Network
|
chengtan9907/OpenSTL · chengtan9907/simvpv2 · Westlake-AI/openmixup
· +4 |
2022 |
| 63 |
MogaNet-XT (Mask R-CNN 1x) |
40.7 | – | – | – | – | – | – |
|
MogaNet: Multi-order Gated Aggregation Network
|
chengtan9907/OpenSTL · chengtan9907/simvpv2 · Westlake-AI/openmixup
· +4 |
2022 |
| 64 |
ViDT Swin-nano |
40.4 | 59.6 | 43.3 | 55.8 | 42.5 | 23.2 | 16M |
|
ViDT: An Efficient and Effective Fully Transformer-based Object Detector
|
naver-ai/vidt |
2021 |
| 65 |
MogaNet-XT (RetinaNet 1x) |
39.7 | – | – | – | – | – | – |
|
MogaNet: Multi-order Gated Aggregation Network
|
chengtan9907/OpenSTL · chengtan9907/simvpv2 · Westlake-AI/openmixup
· +4 |
2022 |
| 66 |
DyHead (Swin-T, multi scale) |
– | 68 | 54.3 | 64.2 | – | – | – |
|
Dynamic Head: Unifying Object Detection Heads with Attentions
|
open-mmlab/mmdetection · microsoft/DynamicHead · Coldestadam/DynamicHead |
2021 |
| 67 |
Mr. DETR (Swin-L, 1x, 5cale) |
61.8 | 79.0 | 67.6 | 75.7 | 65.6 | 47.7 | – |
✓ |
Mr. DETR: Instructive Multi-Route Training for Detection Transformers
|
Visual-AI/Mr.DETR |
2024 |
| 68 |
Mr. DETR (Swin-L, 1x, 4scale) |
58.4 | 76.3 | 63.9 | 75.3 | 62.8 | 40.8 | – |
|
Mr. DETR: Instructive Multi-Route Training for Detection Transformers
|
Visual-AI/Mr.DETR |
2024 |
| 69 |
MI-DETR (Swin-L 1x) |
58.2 | 76.5 | 63.4 | 74.6 | 62.8 | 42.5 | – |
|
MI-DETR: An Object Detection Model with Multi-time Inquiries Mechanism
|
CQU-ADHRI-Lab/MI-DETR |
2025 |
| 70 |
Relation-DETR (Swin-L 2x) |
58.1 | 76.4 | 63.5 | 73.5 | 63.0 | 41.8 | – |
|
Relation DETR: Exploring Explicit Position Relation Prior for Object Detection
|
xiuqhou/relation-detr · xiuqhou/Salience-DETR |
2024 |
| 71 |
Relation-DETR (Swin-L 1x) |
57.8 | 76.1 | 62.9 | 74.4 | 62.1 | 41.2 | – |
|
Relation DETR: Exploring Explicit Position Relation Prior for Object Detection
|
xiuqhou/relation-detr · xiuqhou/Salience-DETR |
2024 |
| 72 |
Salience-DETR (Focal-L 1x) |
57.3 | 75.5 | 62.3 | 74.5 | 61.8 | 40.9 | 220M |
|
Salience DETR: Enhancing Detection Transformer with Hierarchical Salience Filtering Refinement
|
xiuqhou/relation-detr · xiuqhou/Salience-DETR · xunull/read-Salience-DETR |
2024 |
| 73 |
YOLOv6-L6(46 fps, V100, bs1) |
57.2 | 74.5 | – | – | – | – | – |
|
YOLOv6 v3.0: A Full-Scale Reloading
|
PaddlePaddle/PaddleDetection · meituan/yolov6 · PaddlePaddle/PaddleYOLO
· +2 |
2023 |
| 74 |
Salience-DETR (Swin-L 1x) |
56.5 | 75.0 | 61.5 | 72.8 | 61.2 | 40.2 | 210M |
|
Salience DETR: Enhancing Detection Transformer with Hierarchical Salience Filtering Refinement
|
xiuqhou/relation-detr · xiuqhou/Salience-DETR · xunull/read-Salience-DETR |
2024 |
| 75 |
MogaNet-XL (Cascade Mask R-CNN) |
56.2 | – | – | – | – | – | – |
|
MogaNet: Multi-order Gated Aggregation Network
|
chengtan9907/OpenSTL · chengtan9907/simvpv2 · Westlake-AI/openmixup
· +4 |
2022 |
| 76 |
MogaNet-L (Cascade Mask R-CNN) |
53.3 | – | – | – | – | – | – |
|
MogaNet: Multi-order Gated Aggregation Network
|
chengtan9907/OpenSTL · chengtan9907/simvpv2 · Westlake-AI/openmixup
· +4 |
2022 |
| 77 |
MogaNet-B (Cascade Mask R-CNN) |
52.6 | – | – | – | – | – | – |
|
MogaNet: Multi-order Gated Aggregation Network
|
chengtan9907/OpenSTL · chengtan9907/simvpv2 · Westlake-AI/openmixup
· +4 |
2022 |
| 78 |
Relation-DETR (ResNet50 2x) |
52.1 | 69.7 | 56.6 | 66.5 | 56.0 | 36.1 | – |
|
Relation DETR: Exploring Explicit Position Relation Prior for Object Detection
|
xiuqhou/relation-detr · xiuqhou/Salience-DETR |
2024 |
| 79 |
Relation-DETR (ResNet50 1x) |
51.7 | 69.1 | 56.3 | 66.1 | 55.6 | 36.1 | – |
|
Relation DETR: Exploring Explicit Position Relation Prior for Object Detection
|
xiuqhou/relation-detr · xiuqhou/Salience-DETR |
2024 |
| 80 |
MogaNet-S (Cascade Mask R-CNN) |
51.6 | – | – | – | – | – | – |
|
MogaNet: Multi-order Gated Aggregation Network
|
chengtan9907/OpenSTL · chengtan9907/simvpv2 · Westlake-AI/openmixup
· +4 |
2022 |
| 81 |
RF-ConvNeXt-T Cascade R-CNN |
50.9 | – | – | – | – | – | – |
|
RF-Next: Efficient Receptive Field Search for Convolutional Neural Networks
|
ShangHua-Gao/G2L-search · ShangHua-Gao/RFNext |
2022 |
| 82 |
Salience-DETR (ResNet50 1x) |
50.0 | 67.7 | 54.2 | 64.4 | 54.4 | 33.3 | 56M |
|
Salience DETR: Enhancing Detection Transformer with Hierarchical Salience Filtering Refinement
|
xiuqhou/relation-detr · xiuqhou/Salience-DETR · xunull/read-Salience-DETR |
2024 |
| 83 |
SQR-Adamixer-R101 |
49.8 | – | – | – | – | – | – |
|
Enhanced Training of Query-Based Object Detection via Selective Query Recollection
|
IDEA-Research/detrex · fangyi-chen/sqr |
2022 |
| 84 |
MogaNet-L (Mask R-CNN 1x) |
49.4 | – | – | – | – | – | – |
|
MogaNet: Multi-order Gated Aggregation Network
|
chengtan9907/OpenSTL · chengtan9907/simvpv2 · Westlake-AI/openmixup
· +4 |
2022 |
| 85 |
ViDT Swin-base |
49.2 | 69.4 | 53.1 | 66.9 | 52.6 | 30.6 | 0.1B |
|
ViDT: An Efficient and Effective Fully Transformer-based Object Detector
|
naver-ai/vidt |
2021 |
| 86 |
SQR-Adamixer-R50 |
48.9 | – | – | – | – | – | – |
|
Enhanced Training of Query-Based Object Detection via Selective Query Recollection
|
IDEA-Research/detrex · fangyi-chen/sqr |
2022 |
| 87 |
MogaNet-L (RetinaNet 1x) |
48.7 | – | – | – | – | – | – |
|
MogaNet: Multi-order Gated Aggregation Network
|
chengtan9907/OpenSTL · chengtan9907/simvpv2 · Westlake-AI/openmixup
· +4 |
2022 |
| 88 |
MogaNet-B (Mask R-CNN 1x) |
47.9 | – | – | – | – | – | – |
|
MogaNet: Multi-order Gated Aggregation Network
|
chengtan9907/OpenSTL · chengtan9907/simvpv2 · Westlake-AI/openmixup
· +4 |
2022 |
| 89 |
MogaNet-B (RetinaNet 1x) |
47.7 | – | – | – | – | – | – |
|
MogaNet: Multi-order Gated Aggregation Network
|
chengtan9907/OpenSTL · chengtan9907/simvpv2 · Westlake-AI/openmixup
· +4 |
2022 |
| 90 |
ViDT Swin-small |
47.5 | 67.7 | 51.4 | 64.8 | 50.7 | 29.2 | 61M |
|
ViDT: An Efficient and Effective Fully Transformer-based Object Detector
|
naver-ai/vidt |
2021 |
| 91 |
MogaNet-S (Mask R-CNN 1x) |
46.7 | – | – | – | – | – | – |
|
MogaNet: Multi-order Gated Aggregation Network
|
chengtan9907/OpenSTL · chengtan9907/simvpv2 · Westlake-AI/openmixup
· +4 |
2022 |
| 92 |
MogaNet-S (RetinaNet 1x) |
45.8 | – | – | – | – | – | – |
|
MogaNet: Multi-order Gated Aggregation Network
|
chengtan9907/OpenSTL · chengtan9907/simvpv2 · Westlake-AI/openmixup
· +4 |
2022 |
| 93 |
ViDT Swin-tiny |
44.8 | 64.5 | 48.7 | 62.1 | 47.6 | 25.9 | 38M |
|
ViDT: An Efficient and Effective Fully Transformer-based Object Detector
|
naver-ai/vidt |
2021 |
| 94 |
MogaNet-T (Mask R-CNN 1x) |
42.6 | – | – | – | – | – | – |
|
MogaNet: Multi-order Gated Aggregation Network
|
chengtan9907/OpenSTL · chengtan9907/simvpv2 · Westlake-AI/openmixup
· +4 |
2022 |
| 95 |
MogaNet-T (RetinaNet 1x) |
41.4 | – | – | – | – | – | – |
|
MogaNet: Multi-order Gated Aggregation Network
|
chengtan9907/OpenSTL · chengtan9907/simvpv2 · Westlake-AI/openmixup
· +4 |
2022 |
| 96 |
MogaNet-XT (Mask R-CNN 1x) |
40.7 | – | – | – | – | – | – |
|
MogaNet: Multi-order Gated Aggregation Network
|
chengtan9907/OpenSTL · chengtan9907/simvpv2 · Westlake-AI/openmixup
· +4 |
2022 |
| 97 |
ViDT Swin-nano |
40.4 | 59.6 | 43.3 | 55.8 | 42.5 | 23.2 | 16M |
|
ViDT: An Efficient and Effective Fully Transformer-based Object Detector
|
naver-ai/vidt |
2021 |
| 98 |
MogaNet-XT (RetinaNet 1x) |
39.7 | – | – | – | – | – | – |
|
MogaNet: Multi-order Gated Aggregation Network
|
chengtan9907/OpenSTL · chengtan9907/simvpv2 · Westlake-AI/openmixup
· +4 |
2022 |
| 99 |
DyHead (Swin-T, multi scale) |
– | 68 | 54.3 | 64.2 | – | – | – |
|
Dynamic Head: Unifying Object Detection Heads with Attentions
|
open-mmlab/mmdetection · microsoft/DynamicHead · Coldestadam/DynamicHead |
2021 |
| 100 |
Mr. DETR (Swin-L, 1x, 5cale) |
61.8 | 79.0 | 67.6 | 75.7 | 65.6 | 47.7 | – |
✓ |
Mr. DETR: Instructive Multi-Route Training for Detection Transformers
|
Visual-AI/Mr.DETR |
2024 |