{"task":"Image Captioning","dataset":"COCO (Common Objects in Context)","metric_names":["CIDEr","BLEU-1","BLEU-2","BLEU-3","BLEU-4","METEOR","ROUGE","ROUGE-L"],"rows":[{"id":47116,"task":"Image Captioning","parent_task":null,"dataset":"COCO (Common Objects in Context)","model_name":"ExpansionNet v2","metrics":{"CIDEr":"143.7"},"paper_url":"https://arxiv.org/abs/2208.06551v4","paper_title":"Exploiting Multiple Sequence Lengths in Fast End to End Training for Image Captioning","paper_date":"2022-08-13","code_links":[{"title":"jchenghu/expansionnet_v2","url":"https://github.com/jchenghu/expansionnet_v2"}],"metrics_order":"[\"CIDEr\", \"BLEU-1\", \"BLEU-2\", \"BLEU-3\", \"BLEU-4\", \"METEOR\", \"ROUGE\", \"ROUGE-L\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":47117,"task":"Image Captioning","parent_task":null,"dataset":"COCO (Common Objects in Context)","model_name":"M2 Transformer","metrics":{"CIDEr":"131.2"},"paper_url":"https://arxiv.org/abs/1912.08226v2","paper_title":"Meshed-Memory Transformer for Image Captioning","paper_date":"2019-12-17","code_links":[{"title":"aimagelab/meshed-memory-transformer","url":"https://github.com/aimagelab/meshed-memory-transformer"},{"title":"Japanese-Image-Captioning/M2-transformer-for-Japanese","url":"https://github.com/Japanese-Image-Captioning/M2-transformer-for-Japanese"}],"metrics_order":"[\"CIDEr\", \"BLEU-1\", \"BLEU-2\", \"BLEU-3\", \"BLEU-4\", \"METEOR\", \"ROUGE\", \"ROUGE-L\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":47118,"task":"Image Captioning","parent_task":null,"dataset":"COCO (Common Objects in Context)","model_name":"IGINet","metrics":{"BLEU-1":"81.1","BLEU-2":"65.9","BLEU-3":"51.7","BLEU-4":"39.9","CIDEr":"131.0","METEOR":"29.4","ROUGE-L":"59.2"},"paper_url":null,"paper_title":null,"paper_date":null,"code_links":[],"metrics_order":"[\"CIDEr\", \"BLEU-1\", \"BLEU-2\", \"BLEU-3\", \"BLEU-4\", \"METEOR\", \"ROUGE\", \"ROUGE-L\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":47119,"task":"Image Captioning","parent_task":null,"dataset":"COCO (Common Objects in Context)","model_name":"UNIMO-large","metrics":{"BLEU-4":"39.6","CIDEr":"127.7"},"paper_url":"https://arxiv.org/abs/2012.15409v4","paper_title":"UNIMO: Towards Unified-Modal Understanding and Generation via Cross-Modal Contrastive Learning","paper_date":"2020-12-31","code_links":[{"title":"PaddlePaddle/PaddleNLP","url":"https://github.com/PaddlePaddle/PaddleNLP/tree/develop/examples/text_generation/unimo-text"},{"title":"PaddlePaddle/Research","url":"https://github.com/PaddlePaddle/Research"},{"title":"PaddlePaddle/Research","url":"https://github.com/PaddlePaddle/Research/tree/master/NLP/UNIMO"}],"metrics_order":"[\"CIDEr\", \"BLEU-1\", \"BLEU-2\", \"BLEU-3\", \"BLEU-4\", \"METEOR\", \"ROUGE\", \"ROUGE-L\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":47120,"task":"Image Captioning","parent_task":null,"dataset":"COCO (Common Objects in Context)","model_name":"RDN","metrics":{"CIDEr":"125.2"},"paper_url":"https://arxiv.org/abs/1908.11824v1","paper_title":"Reflective Decoding Network for Image Captioning","paper_date":"2019-08-30","code_links":[],"metrics_order":"[\"CIDEr\", \"BLEU-1\", \"BLEU-2\", \"BLEU-3\", \"BLEU-4\", \"METEOR\", \"ROUGE\", \"ROUGE-L\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":47121,"task":"Image Captioning","parent_task":null,"dataset":"COCO (Common Objects in Context)","model_name":"Lyrics","metrics":{"CIDEr":"121.1"},"paper_url":"https://arxiv.org/abs/2312.05278v2","paper_title":"Lyrics: Boosting Fine-grained Language-Vision Alignment and Comprehension via Semantic-aware Visual Objects","paper_date":"2023-12-08","code_links":[],"metrics_order":"[\"CIDEr\", \"BLEU-1\", \"BLEU-2\", \"BLEU-3\", \"BLEU-4\", \"METEOR\", \"ROUGE\", \"ROUGE-L\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":47122,"task":"Image Captioning","parent_task":null,"dataset":"COCO (Common Objects in Context)","model_name":"Bit Diffusion (20 steps)","metrics":{"BLEU-4":"34.7","CIDEr":"115","ROUGE-L":"58"},"paper_url":"https://arxiv.org/abs/2208.04202v2","paper_title":"Analog Bits: Generating Discrete Data using Diffusion Models with Self-Conditioning","paper_date":"2022-08-08","code_links":[{"title":"lucidrains/imagen-pytorch","url":"https://github.com/lucidrains/imagen-pytorch"},{"title":"google-research/pix2seq","url":"https://github.com/google-research/pix2seq"},{"title":"pinellolab/dna-diffusion","url":"https://github.com/pinellolab/dna-diffusion"},{"title":"lucidrains/bit-diffusion","url":"https://github.com/lucidrains/bit-diffusion"},{"title":"lucidrains/chroma-pytorch","url":"https://github.com/lucidrains/chroma-pytorch"},{"title":"facebookresearch/flowmm","url":"https://github.com/facebookresearch/flowmm"},{"title":"yiyixuxu/denoising-diffusion-flax","url":"https://github.com/yiyixuxu/denoising-diffusion-flax"}],"metrics_order":"[\"CIDEr\", \"BLEU-1\", \"BLEU-2\", \"BLEU-3\", \"BLEU-4\", \"METEOR\", \"ROUGE\", \"ROUGE-L\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":47123,"task":"Image Captioning","parent_task":null,"dataset":"COCO (Common Objects in Context)","model_name":"Flamingo (80B; 4-shot)","metrics":{"CIDEr":"103"},"paper_url":"https://arxiv.org/abs/2211.12561v2","paper_title":"Retrieval-Augmented Multimodal Language Modeling","paper_date":"2022-11-22","code_links":[],"metrics_order":"[\"CIDEr\", \"BLEU-1\", \"BLEU-2\", \"BLEU-3\", \"BLEU-4\", \"METEOR\", \"ROUGE\", \"ROUGE-L\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":47124,"task":"Image Captioning","parent_task":null,"dataset":"COCO (Common Objects in Context)","model_name":"RA-CM3 (2.7B)","metrics":{"CIDEr":"89.1"},"paper_url":"https://arxiv.org/abs/2211.12561v2","paper_title":"Retrieval-Augmented Multimodal Language Modeling","paper_date":"2022-11-22","code_links":[],"metrics_order":"[\"CIDEr\", \"BLEU-1\", \"BLEU-2\", \"BLEU-3\", \"BLEU-4\", \"METEOR\", \"ROUGE\", \"ROUGE-L\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":47125,"task":"Image Captioning","parent_task":null,"dataset":"COCO (Common Objects in Context)","model_name":"Flamingo (3B; 4-shot)","metrics":{"CIDEr":"85"},"paper_url":"https://arxiv.org/abs/2211.12561v2","paper_title":"Retrieval-Augmented Multimodal Language Modeling","paper_date":"2022-11-22","code_links":[],"metrics_order":"[\"CIDEr\", \"BLEU-1\", \"BLEU-2\", \"BLEU-3\", \"BLEU-4\", \"METEOR\", \"ROUGE\", \"ROUGE-L\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":47126,"task":"Image Captioning","parent_task":null,"dataset":"COCO (Common Objects in Context)","model_name":"Parti","metrics":{"CIDEr":"83.9"},"paper_url":"https://arxiv.org/abs/2211.12561v2","paper_title":"Retrieval-Augmented Multimodal Language Modeling","paper_date":"2022-11-22","code_links":[],"metrics_order":"[\"CIDEr\", \"BLEU-1\", \"BLEU-2\", \"BLEU-3\", \"BLEU-4\", \"METEOR\", \"ROUGE\", \"ROUGE-L\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":47127,"task":"Image Captioning","parent_task":null,"dataset":"COCO (Common Objects in Context)","model_name":"NIC (ResNet-50, CutMix)","metrics":{"BLEU-1":"64.2","BLEU-2":"46.3","BLEU-3":"33.6","BLEU-4":"24.9","CIDEr":"77.6","METEOR":"23.1","ROUGE":"49"},"paper_url":"https://arxiv.org/abs/1905.04899v2","paper_title":"CutMix: Regularization Strategy to Train Strong Classifiers with Localizable Features","paper_date":"2019-05-13","code_links":[{"title":"rwightman/pytorch-image-models","url":"https://github.com/rwightman/pytorch-image-models"},{"title":"pytorch/vision","url":"https://github.com/pytorch/vision"},{"title":"kornia/kornia","url":"https://github.com/kornia/kornia"},{"title":"PaddlePaddle/PaddleClas","url":"https://github.com/PaddlePaddle/PaddleClas"},{"title":"open-mmlab/mmclassification","url":"https://github.com/open-mmlab/mmclassification"},{"title":"clovaai/CutMix-PyTorch","url":"https://github.com/clovaai/CutMix-PyTorch"},{"title":"Westlake-AI/openmixup","url":"https://github.com/Westlake-AI/openmixup"},{"title":"ildoonet/cutmix","url":"https://github.com/ildoonet/cutmix"},{"title":"hysts/pytorch_cutmix","url":"https://github.com/hysts/pytorch_cutmix"},{"title":"IlyaDobrynin/GridMixup","url":"https://github.com/IlyaDobrynin/GridMixup"},{"title":"DevBruce/CutMixImageDataGenerator_For_Keras","url":"https://github.com/DevBruce/CutMixImageDataGenerator_For_Keras"},{"title":"wangermeng2021/FastClassification","url":"https://github.com/wangermeng2021/FastClassification"},{"title":"jis478/Tensorflow","url":"https://github.com/jis478/Tensorflow/tree/master/TF2.0/Cutmix"},{"title":"kboseong/RotNet","url":"https://github.com/kboseong/RotNet"},{"title":"TianshuXie/Cut-Thumbnail","url":"https://github.com/TianshuXie/Cut-Thumbnail"},{"title":"xden2331/attentive_cutmix","url":"https://github.com/xden2331/attentive_cutmix"},{"title":"hh-xiaohu/Image-augementation-pytorch","url":"https://github.com/hh-xiaohu/Image-augementation-pytorch"},{"title":"Bennie-Han/Image-augementation-pytorch","url":"https://github.com/Bennie-Han/Image-augementation-pytorch"},{"title":"sangHa0411/VIT","url":"https://github.com/sangHa0411/VIT"},{"title":"airplane2230/keras_cutmix","url":"https://github.com/airplane2230/keras_cutmix"},{"title":"js-aguiar/wheat-object-detection","url":"https://github.com/js-aguiar/wheat-object-detection"},{"title":"juergenlandauer/Maya-Challenge","url":"https://github.com/juergenlandauer/Maya-Challenge"},{"title":"jis478/cutmix_tensorflow2","url":"https://github.com/jis478/cutmix_tensorflow2"},{"title":"toshi-k/kaggle-bengaliai-handwritten-grapheme-classification","url":"https://github.com/toshi-k/kaggle-bengaliai-handwritten-grapheme-classification"},{"title":"PsorTheDoctor/microarray-data","url":"https://github.com/PsorTheDoctor/microarray-data"},{"title":"Kaushal28/CutMix-Regularization-using-PyTorch","url":"https://github.com/Kaushal28/CutMix-Regularization-using-PyTorch"},{"title":"SyogoShibuya/Chainer-Cutmix","url":"https://github.com/SyogoShibuya/Chainer-Cutmix"},{"title":"liuch37/image-processing","url":"https://github.com/liuch37/image-processing"},{"title":"dongdong69/MixAugmentation","url":"https://github.com/dongdong69/MixAugmentation"},{"title":"sangHa0411/ImageNet","url":"https://github.com/sangHa0411/ImageNet"}],"metrics_order":"[\"CIDEr\", \"BLEU-1\", \"BLEU-2\", \"BLEU-3\", \"BLEU-4\", \"METEOR\", \"ROUGE\", \"ROUGE-L\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":47128,"task":"Image Captioning","parent_task":null,"dataset":"COCO (Common Objects in Context)","model_name":"Vanilla CM3","metrics":{"CIDEr":"71.9"},"paper_url":"https://arxiv.org/abs/2211.12561v2","paper_title":"Retrieval-Augmented Multimodal Language Modeling","paper_date":"2022-11-22","code_links":[],"metrics_order":"[\"CIDEr\", \"BLEU-1\", \"BLEU-2\", \"BLEU-3\", \"BLEU-4\", \"METEOR\", \"ROUGE\", \"ROUGE-L\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":47129,"task":"Image Captioning","parent_task":null,"dataset":"COCO (Common Objects in Context)","model_name":"X-LXMERT","metrics":{"CIDEr":"55.8"},"paper_url":"https://arxiv.org/abs/2211.12561v2","paper_title":"Retrieval-Augmented Multimodal Language Modeling","paper_date":"2022-11-22","code_links":[],"metrics_order":"[\"CIDEr\", \"BLEU-1\", \"BLEU-2\", \"BLEU-3\", \"BLEU-4\", \"METEOR\", \"ROUGE\", \"ROUGE-L\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":47130,"task":"Image Captioning","parent_task":null,"dataset":"COCO (Common Objects in Context)","model_name":"minDALL-E","metrics":{"CIDEr":"48"},"paper_url":"https://arxiv.org/abs/2211.12561v2","paper_title":"Retrieval-Augmented Multimodal Language Modeling","paper_date":"2022-11-22","code_links":[],"metrics_order":"[\"CIDEr\", \"BLEU-1\", \"BLEU-2\", \"BLEU-3\", \"BLEU-4\", \"METEOR\", \"ROUGE\", \"ROUGE-L\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":47131,"task":"Image Captioning","parent_task":null,"dataset":"COCO (Common Objects in Context)","model_name":"ruDALL-E-XL","metrics":{"CIDEr":"38.7"},"paper_url":"https://arxiv.org/abs/2211.12561v2","paper_title":"Retrieval-Augmented Multimodal Language Modeling","paper_date":"2022-11-22","code_links":[],"metrics_order":"[\"CIDEr\", \"BLEU-1\", \"BLEU-2\", \"BLEU-3\", \"BLEU-4\", \"METEOR\", \"ROUGE\", \"ROUGE-L\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":47132,"task":"Image Captioning","parent_task":null,"dataset":"COCO (Common Objects in Context)","model_name":"DALL-E","metrics":{"CIDEr":"20.2"},"paper_url":"https://arxiv.org/abs/2211.12561v2","paper_title":"Retrieval-Augmented Multimodal Language Modeling","paper_date":"2022-11-22","code_links":[],"metrics_order":"[\"CIDEr\", \"BLEU-1\", \"BLEU-2\", \"BLEU-3\", \"BLEU-4\", \"METEOR\", \"ROUGE\", \"ROUGE-L\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]}]}