{"task":"Document Layout Analysis","dataset":"PubLayNet val","metric_names":["Overall","Text","Title","List","Table","Figure"],"rows":[{"id":86530,"task":"Document Layout Analysis","parent_task":null,"dataset":"PubLayNet val","model_name":"VGT","metrics":{"Figure":"0.971","List":"0.968","Overall":"0.962","Table":"0.981","Text":"0.950","Title":"0.939"},"paper_url":"https://arxiv.org/abs/2308.14978v1","paper_title":"Vision Grid Transformer for Document Layout Analysis","paper_date":"2023-08-29","code_links":[{"title":"alibabaresearch/advancedliteratemachinery","url":"https://github.com/alibabaresearch/advancedliteratemachinery"}],"metrics_order":"[\"Overall\", \"Text\", \"Title\", \"List\", \"Table\", \"Figure\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":86531,"task":"Document Layout Analysis","parent_task":null,"dataset":"PubLayNet val","model_name":"TRDLU","metrics":{"Figure":"0.966","List":"0.975","Overall":"0.959","Table":"0.976","Text":"0.958","Title":"0.921"},"paper_url":"https://ieeexplore.ieee.org/abstract/document/9897491","paper_title":"Transformer-based Approach for Document Understanding","paper_date":"2022-10-16","code_links":[],"metrics_order":"[\"Overall\", \"Text\", \"Title\", \"List\", \"Table\", \"Figure\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":86532,"task":"Document Layout Analysis","parent_task":null,"dataset":"PubLayNet val","model_name":"VSR","metrics":{"Figure":"0.964","List":"0.947","Overall":"0.957","Table":"0.974","Text":"0.967","Title":"0.931"},"paper_url":"https://arxiv.org/abs/2105.06220v1","paper_title":"VSR: A Unified Framework for Document Layout Analysis combining Vision, Semantics and Relations","paper_date":"2021-05-13","code_links":[{"title":"hikopensource/davar-lab-ocr","url":"https://github.com/hikopensource/davar-lab-ocr"}],"metrics_order":"[\"Overall\", \"Text\", \"Title\", \"List\", \"Table\", \"Figure\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":86533,"task":"Document Layout Analysis","parent_task":null,"dataset":"PubLayNet val","model_name":"DETR","metrics":{"Figure":"0.975","List":"0.964","Overall":"0.957","Table":"0.981","Text":"0.947","Title":"0.918"},"paper_url":"https://arxiv.org/abs/2306.13526v1","paper_title":"Bridging the Performance Gap between DETR and R-CNN for Graphical Object Detection in Document Images","paper_date":"2023-06-23","code_links":[],"metrics_order":"[\"Overall\", \"Text\", \"Title\", \"List\", \"Table\", \"Figure\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":86534,"task":"Document Layout Analysis","parent_task":null,"dataset":"PubLayNet val","model_name":"LayoutLMv3-B","metrics":{"Figure":"0.970","List":"0.955","Overall":"0.951","Table":"0.979","Text":"0.945","Title":"0.906"},"paper_url":"https://arxiv.org/abs/2204.08387v3","paper_title":"LayoutLMv3: Pre-training for Document AI with Unified Text and Image Masking","paper_date":"2022-04-18","code_links":[{"title":"huggingface/transformers","url":"https://github.com/huggingface/transformers"},{"title":"microsoft/unilm","url":"https://github.com/microsoft/unilm/tree/master/layoutlmv3"},{"title":"pwc-1/Paper-9","url":"https://github.com/pwc-1/Paper-9/tree/main/layoutlmv3"},{"title":"MindSpore-scientific-2/code-14","url":"https://github.com/MindSpore-scientific-2/code-14/tree/main/layoutlmv3"}],"metrics_order":"[\"Overall\", \"Text\", \"Title\", \"List\", \"Table\", \"Figure\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":86535,"task":"Document Layout Analysis","parent_task":null,"dataset":"PubLayNet val","model_name":"DoPTA","metrics":{"Figure":"0.970","List":"0.957","Overall":"0.949","Table":"0.977","Text":"0.944","Title":"0.895"},"paper_url":"https://arxiv.org/abs/2412.12902v1","paper_title":"DoPTA: Improving Document Layout Analysis using Patch-Text Alignment","paper_date":"2024-12-17","code_links":[],"metrics_order":"[\"Overall\", \"Text\", \"Title\", \"List\", \"Table\", \"Figure\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":86536,"task":"Document Layout Analysis","parent_task":null,"dataset":"PubLayNet val","model_name":"DiT-L","metrics":{"Figure":"0.972","List":"0.960","Overall":"0.949","Table":"0.978","Text":"0.944","Title":"0.893"},"paper_url":"https://arxiv.org/abs/2203.02378v3","paper_title":"DiT: Self-supervised Pre-training for Document Image Transformer","paper_date":"2022-03-04","code_links":[{"title":"huggingface/transformers","url":"https://github.com/huggingface/transformers"},{"title":"microsoft/unilm","url":"https://github.com/microsoft/unilm/tree/master/dit"},{"title":"thibaultvt/Diard","url":"https://github.com/thibaultvt/Diard"},{"title":"MindCode-4/code-3","url":"https://github.com/MindCode-4/code-3/tree/main/deit"}],"metrics_order":"[\"Overall\", \"Text\", \"Title\", \"List\", \"Table\", \"Figure\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":86537,"task":"Document Layout Analysis","parent_task":null,"dataset":"PubLayNet val","model_name":"UDoc","metrics":{"Figure":"0.964","List":"0.937","Overall":"0.939","Table":"0.973","Text":"0.939","Title":"0.885"},"paper_url":"https://arxiv.org/abs/2204.10939v2","paper_title":"Unified Pretraining Framework for Document Understanding","paper_date":"2022-04-22","code_links":[],"metrics_order":"[\"Overall\", \"Text\", \"Title\", \"List\", \"Table\", \"Figure\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":86538,"task":"Document Layout Analysis","parent_task":null,"dataset":"PubLayNet val","model_name":"ResNext-101-32×8d","metrics":{"Figure":"0.968","List":"0.940","Overall":"0.935","Table":"0.976","Text":"0.930","Title":"0.862"},"paper_url":"https://arxiv.org/abs/2308.14978v1","paper_title":"Vision Grid Transformer for Document Layout Analysis","paper_date":"2023-08-29","code_links":[{"title":"alibabaresearch/advancedliteratemachinery","url":"https://github.com/alibabaresearch/advancedliteratemachinery"}],"metrics_order":"[\"Overall\", \"Text\", \"Title\", \"List\", \"Table\", \"Figure\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":86539,"task":"Document Layout Analysis","parent_task":null,"dataset":"PubLayNet val","model_name":"DeiT-B","metrics":{"Figure":"0.957","List":" 0.921","Overall":"0.932","Table":"0.972","Text":"0.934","Title":"0.874"},"paper_url":"https://arxiv.org/abs/2012.12877v2","paper_title":"Training data-efficient image transformers & distillation through attention","paper_date":"2020-12-23","code_links":[{"title":"huggingface/transformers","url":"https://github.com/huggingface/transformers"},{"title":"rwightman/pytorch-image-models","url":"https://github.com/rwightman/pytorch-image-models"},{"title":"PaddlePaddle/PaddleClas","url":"https://github.com/PaddlePaddle/PaddleClas"},{"title":"facebookresearch/deit","url":"https://github.com/facebookresearch/deit"},{"title":"hustvl/vim","url":"https://github.com/hustvl/vim"},{"title":"alibaba/EasyCV","url":"https://github.com/alibaba/EasyCV"},{"title":"BR-IDL/PaddleViT","url":"https://github.com/BR-IDL/PaddleViT/blob/main/image_classification/DeiT"},{"title":"open-edge-platform/training_extensions","url":"https://github.com/open-edge-platform/training_extensions"},{"title":"jacobgil/vit-explain","url":"https://github.com/jacobgil/vit-explain"},{"title":"TACJu/TransFG","url":"https://github.com/TACJu/TransFG"},{"title":"open-edge-platform/geti","url":"https://github.com/open-edge-platform/geti"},{"title":"omihub777/vit-cifar","url":"https://github.com/omihub777/vit-cifar"},{"title":"PaddlePaddle/PLSC","url":"https://github.com/PaddlePaddle/PLSC/tree/master/task/classification/deit"},{"title":"moein-shariatnia/Pix2Seq","url":"https://github.com/moein-shariatnia/Pix2Seq"},{"title":"gatech-eic/vitcod","url":"https://github.com/gatech-eic/vitcod"},{"title":"cogtoolslab/physics-benchmarking-neurips2021","url":"https://github.com/cogtoolslab/physics-benchmarking-neurips2021"},{"title":"UdbhavPrasad072300/Transformer-Implementations","url":"https://github.com/UdbhavPrasad072300/Transformer-Implementations"},{"title":"aiot-mlsys-lab/famba-v","url":"https://github.com/aiot-mlsys-lab/famba-v"},{"title":"zhuhanqing/lightening-transformer","url":"https://github.com/zhuhanqing/lightening-transformer"},{"title":"wangyz1608/knowledge-distillation-via-nd","url":"https://github.com/wangyz1608/knowledge-distillation-via-nd"},{"title":"birder/birder","url":"https://gitlab.com/birder/birder"},{"title":"affjljoo3581/deit3-jax","url":"https://github.com/affjljoo3581/deit3-jax"},{"title":"mindspore-courses/External-Attention-MindSpore","url":"https://github.com/mindspore-courses/External-Attention-MindSpore/blob/main/model/backbone/DeiT.py"},{"title":"alessiomora/unlearning_fl","url":"https://github.com/alessiomora/unlearning_fl"},{"title":"smu-ivpl/DeepfakeDetection","url":"https://github.com/smu-ivpl/DeepfakeDetection"},{"title":"ttt496/vit-pytorch","url":"https://github.com/ttt496/vit-pytorch"},{"title":"nus-hpc-ai-lab/dyvm","url":"https://github.com/nus-hpc-ai-lab/dyvm"},{"title":"IMvision12/keras-vision-models","url":"https://github.com/IMvision12/keras-vision-models"},{"title":"tianhai123/vit-pytorch","url":"https://github.com/tianhai123/vit-pytorch"},{"title":"skchen1993/TrangFG","url":"https://github.com/skchen1993/TrangFG"},{"title":"holdfire/FAS","url":"https://github.com/holdfire/FAS"},{"title":"holdfire/CLS","url":"https://github.com/holdfire/CLS"},{"title":"Oguzhanercan/Vision-Transformers","url":"https://github.com/Oguzhanercan/Vision-Transformers"},{"title":"Burf/VisionTransformer-Tensorflow2","url":"https://github.com/Burf/VisionTransformer-Tensorflow2"},{"title":"s-chh/patchrot","url":"https://github.com/s-chh/patchrot"},{"title":"ahmedelmahy/myownvit","url":"https://github.com/ahmedelmahy/myownvit"},{"title":"asrafulashiq/deit-custom","url":"https://github.com/asrafulashiq/deit-custom"},{"title":"code-implementation1/Code1","url":"https://github.com/code-implementation1/Code1/tree/main/DeiT"},{"title":"liuxingwt/CLS","url":"https://github.com/liuxingwt/CLS"},{"title":"bshantam97/Attention_Based_Networks","url":"https://github.com/bshantam97/Attention_Based_Networks"}],"metrics_order":"[\"Overall\", \"Text\", \"Title\", \"List\", \"Table\", \"Figure\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":86540,"task":"Document Layout Analysis","parent_task":null,"dataset":"PubLayNet val","model_name":"BEiT-B","metrics":{"Figure":" 0.957","List":"0.924","Overall":"0.931","Table":"0.973","Text":"0.934","Title":"0.866"},"paper_url":"https://arxiv.org/abs/2106.08254v2","paper_title":"BEiT: BERT Pre-Training of Image Transformers","paper_date":"2021-06-15","code_links":[{"title":"huggingface/transformers","url":"https://github.com/huggingface/transformers"},{"title":"rwightman/pytorch-image-models","url":"https://github.com/rwightman/pytorch-image-models"},{"title":"microsoft/unilm","url":"https://github.com/microsoft/unilm/tree/master/beit"},{"title":"facebookresearch/vissl","url":"https://github.com/facebookresearch/vissl"},{"title":"pengzhiliang/MAE-pytorch","url":"https://github.com/pengzhiliang/MAE-pytorch"},{"title":"leondgarse/keras_cv_attention_models","url":"https://github.com/leondgarse/keras_cv_attention_models/tree/main/keras_cv_attention_models/beit"},{"title":"sunsmarterjie/itpn","url":"https://github.com/sunsmarterjie/itpn"},{"title":"facebookresearch/data2vec_vision","url":"https://github.com/facebookresearch/data2vec_vision"},{"title":"yyk-wew/semanticmim","url":"https://github.com/yyk-wew/semanticmim"},{"title":"E-DEEP/PapersReview","url":"https://github.com/E-DEEP/PapersReview"},{"title":"2024-MindSpore-1/Code2","url":"https://github.com/2024-MindSpore-1/Code2/tree/main/model-1/beit"},{"title":"yangyucheng000/University","url":"https://github.com/yangyucheng000/University/tree/main/model-2/beit"},{"title":"woctezuma/steam-BEiT","url":"https://github.com/woctezuma/steam-BEiT"},{"title":"2024-MindSpore-1/Code6","url":"https://github.com/2024-MindSpore-1/Code6/tree/main/beit"}],"metrics_order":"[\"Overall\", \"Text\", \"Title\", \"List\", \"Table\", \"Figure\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":86541,"task":"Document Layout Analysis","parent_task":null,"dataset":"PubLayNet val","model_name":"Mask RCNN","metrics":{"Figure":"0.949","List":"0.886","Overall":"0.910","Table":"0.960","Text":"0.916","Title":"0.840"},"paper_url":"https://arxiv.org/abs/1908.07836v1","paper_title":"PubLayNet: largest dataset ever for document layout analysis","paper_date":"2019-08-16","code_links":[{"title":"ibm-aur-nlp/PubLayNet","url":"https://github.com/ibm-aur-nlp/PubLayNet"},{"title":"ibm-aur-nlp/PubTabNet","url":"https://github.com/ibm-aur-nlp/PubTabNet"},{"title":"hpanwar08/detectron2","url":"https://github.com/hpanwar08/detectron2"},{"title":"phamquiluan/publaynet","url":"https://github.com/phamquiluan/publaynet"},{"title":"adlnlp/doc_gcn","url":"https://github.com/adlnlp/doc_gcn"},{"title":"pisalore/FRCNN_teX-annotator","url":"https://github.com/pisalore/FRCNN_teX-annotator"}],"metrics_order":"[\"Overall\", \"Text\", \"Title\", \"List\", \"Table\", \"Figure\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":86542,"task":"Document Layout Analysis","parent_task":null,"dataset":"PubLayNet val","model_name":"Faster RCNN","metrics":{"Figure":"0.937","List":"0.883","Overall":"0.902","Table":"0.954","Text":"0.910","Title":"0.826"},"paper_url":"https://arxiv.org/abs/1908.07836v1","paper_title":"PubLayNet: largest dataset ever for document layout analysis","paper_date":"2019-08-16","code_links":[{"title":"ibm-aur-nlp/PubLayNet","url":"https://github.com/ibm-aur-nlp/PubLayNet"},{"title":"ibm-aur-nlp/PubTabNet","url":"https://github.com/ibm-aur-nlp/PubTabNet"},{"title":"hpanwar08/detectron2","url":"https://github.com/hpanwar08/detectron2"},{"title":"phamquiluan/publaynet","url":"https://github.com/phamquiluan/publaynet"},{"title":"adlnlp/doc_gcn","url":"https://github.com/adlnlp/doc_gcn"},{"title":"pisalore/FRCNN_teX-annotator","url":"https://github.com/pisalore/FRCNN_teX-annotator"}],"metrics_order":"[\"Overall\", \"Text\", \"Title\", \"List\", \"Table\", \"Figure\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":86543,"task":"Document Layout Analysis","parent_task":null,"dataset":"PubLayNet val","model_name":"GLAM","metrics":{"Figure":"0.206","List":"0.862","Overall":"0.722","Table":"0.868","Text":"0.878","Title":"0.800"},"paper_url":"https://arxiv.org/abs/2308.02051v1","paper_title":"A Graphical Approach to Document Layout Analysis","paper_date":"2023-08-03","code_links":[{"title":"ivanstepanovftw/glam","url":"https://github.com/ivanstepanovftw/glam"}],"metrics_order":"[\"Overall\", \"Text\", \"Title\", \"List\", \"Table\", \"Figure\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":86544,"task":"Document Layout Analysis","parent_task":null,"dataset":"PubLayNet val","model_name":"CDeC-Net","metrics":{"Table":"0.978"},"paper_url":"https://arxiv.org/abs/2008.10831v1","paper_title":"CDeC-Net: Composite Deformable Cascade Network for Table Detection in Document Images","paper_date":"2020-08-25","code_links":[{"title":"mdv3101/CDeCNet","url":"https://github.com/mdv3101/CDeCNet"},{"title":"samarthramesh/CDeC-Net","url":"https://github.com/samarthramesh/CDeC-Net"},{"title":"2023-MindSpore-4/Code2","url":"https://github.com/2023-MindSpore-4/Code2/tree/main/DDAG"}],"metrics_order":"[\"Overall\", \"Text\", \"Title\", \"List\", \"Table\", \"Figure\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]}]}