{"task":"MMR total","dataset":"MRR-Benchmark","metric_names":["Total Column Score"],"rows":[{"id":148992,"task":"MMR total","parent_task":null,"dataset":"MRR-Benchmark","model_name":"Claude 3.5 Sonnet","metrics":{"Total Column Score":"463"},"paper_url":"https://www-cdn.anthropic.com/fed9cc193a14b84131812372d8d5857f8f304c52/Model_Card_Claude_3_Addendum.pdf","paper_title":"Claude 3.5 Sonnet Model Card Addendum","paper_date":"2024-06-24","code_links":[],"metrics_order":"[\"Total Column Score\"]","area":"Computer Vision","uses_additional_data":1,"source":"archive","tags":[]},{"id":148993,"task":"MMR total","parent_task":null,"dataset":"MRR-Benchmark","model_name":"GPT-4o","metrics":{"Total Column Score":"457"},"paper_url":"https://arxiv.org/abs/2406.09781v1","paper_title":"GPT-4o: Visual perception performance of multimodal large language models in piglet activity understanding","paper_date":"2024-06-14","code_links":[],"metrics_order":"[\"Total Column Score\"]","area":"Computer Vision","uses_additional_data":1,"source":"archive","tags":[]},{"id":148994,"task":"MMR total","parent_task":null,"dataset":"MRR-Benchmark","model_name":"GPT-4V","metrics":{"Total Column Score":"415"},"paper_url":"https://arxiv.org/abs/2309.17421v2","paper_title":"The Dawn of LMMs: Preliminary Explorations with GPT-4V(ision)","paper_date":"2023-09-29","code_links":[{"title":"qi-zhangyang/gemini-vs-gpt4v","url":"https://github.com/qi-zhangyang/gemini-vs-gpt4v"},{"title":"vista-h/gpt-4v_social_media","url":"https://github.com/vista-h/gpt-4v_social_media"}],"metrics_order":"[\"Total Column Score\"]","area":"Computer Vision","uses_additional_data":1,"source":"archive","tags":[]},{"id":148995,"task":"MMR total","parent_task":null,"dataset":"MRR-Benchmark","model_name":"LLaVA-NEXT-34B","metrics":{"Total Column Score":"412"},"paper_url":"https://arxiv.org/abs/2304.08485v2","paper_title":"Visual Instruction Tuning","paper_date":"2023-04-17","code_links":[{"title":"huggingface/transformers","url":"https://github.com/huggingface/transformers"},{"title":"haotian-liu/LLaVA","url":"https://github.com/haotian-liu/LLaVA"},{"title":"LLaVA-VL/LLaVA-NeXT","url":"https://github.com/LLaVA-VL/LLaVA-NeXT"},{"title":"computer-vision-in-the-wild/cvinw_readings","url":"https://github.com/computer-vision-in-the-wild/cvinw_readings"},{"title":"skunkworksai/bakllava","url":"https://github.com/skunkworksai/bakllava"},{"title":"tabtoyou/kollava","url":"https://github.com/tabtoyou/kollava"},{"title":"camenduru/llava-colab","url":"https://github.com/camenduru/llava-colab"},{"title":"sshh12/multi_token","url":"https://github.com/sshh12/multi_token"},{"title":"sunsmarterjie/chatterbox","url":"https://github.com/sunsmarterjie/chatterbox"},{"title":"ZhangYiqun018/StickerConv","url":"https://github.com/ZhangYiqun018/StickerConv"},{"title":"llava-annonymous/llava","url":"https://github.com/llava-annonymous/llava"},{"title":"qiujihao19/artemis","url":"https://github.com/qiujihao19/artemis"},{"title":"dinhvietcuong1996/icme25-inova","url":"https://github.com/dinhvietcuong1996/icme25-inova"}],"metrics_order":"[\"Total Column Score\"]","area":"Computer Vision","uses_additional_data":1,"source":"archive","tags":[]},{"id":148996,"task":"MMR total","parent_task":null,"dataset":"MRR-Benchmark","model_name":"Phi-3-Vision","metrics":{"Total Column Score":"397"},"paper_url":"https://arxiv.org/abs/2404.14219v4","paper_title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","paper_date":"2024-04-22","code_links":[],"metrics_order":"[\"Total Column Score\"]","area":"Computer Vision","uses_additional_data":1,"source":"archive","tags":[]},{"id":148997,"task":"MMR total","parent_task":null,"dataset":"MRR-Benchmark","model_name":"InternVL2-8B","metrics":{"Total Column Score":"368"},"paper_url":"https://arxiv.org/abs/2312.14238v3","paper_title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","paper_date":"2023-12-21","code_links":[{"title":"opengvlab/internvl","url":"https://github.com/opengvlab/internvl"},{"title":"opengvlab/internvl-mmdetseg","url":"https://github.com/opengvlab/internvl-mmdetseg"}],"metrics_order":"[\"Total Column Score\"]","area":"Computer Vision","uses_additional_data":1,"source":"archive","tags":[]},{"id":148998,"task":"MMR total","parent_task":null,"dataset":"MRR-Benchmark","model_name":"Qwen-vl-max","metrics":{"Total Column Score":"366"},"paper_url":"https://arxiv.org/abs/2308.12966v3","paper_title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","paper_date":"2023-08-24","code_links":[{"title":"qwenlm/qwen-vl","url":"https://github.com/qwenlm/qwen-vl"},{"title":"brandon3964/multimodal-task-vector","url":"https://github.com/brandon3964/multimodal-task-vector"}],"metrics_order":"[\"Total Column Score\"]","area":"Computer Vision","uses_additional_data":1,"source":"archive","tags":[]},{"id":148999,"task":"MMR total","parent_task":null,"dataset":"MRR-Benchmark","model_name":"LLaVA-NEXT-13B","metrics":{"Total Column Score":"335"},"paper_url":"https://arxiv.org/abs/2304.08485v2","paper_title":"Visual Instruction Tuning","paper_date":"2023-04-17","code_links":[{"title":"huggingface/transformers","url":"https://github.com/huggingface/transformers"},{"title":"haotian-liu/LLaVA","url":"https://github.com/haotian-liu/LLaVA"},{"title":"LLaVA-VL/LLaVA-NeXT","url":"https://github.com/LLaVA-VL/LLaVA-NeXT"},{"title":"computer-vision-in-the-wild/cvinw_readings","url":"https://github.com/computer-vision-in-the-wild/cvinw_readings"},{"title":"skunkworksai/bakllava","url":"https://github.com/skunkworksai/bakllava"},{"title":"tabtoyou/kollava","url":"https://github.com/tabtoyou/kollava"},{"title":"camenduru/llava-colab","url":"https://github.com/camenduru/llava-colab"},{"title":"sshh12/multi_token","url":"https://github.com/sshh12/multi_token"},{"title":"sunsmarterjie/chatterbox","url":"https://github.com/sunsmarterjie/chatterbox"},{"title":"ZhangYiqun018/StickerConv","url":"https://github.com/ZhangYiqun018/StickerConv"},{"title":"llava-annonymous/llava","url":"https://github.com/llava-annonymous/llava"},{"title":"qiujihao19/artemis","url":"https://github.com/qiujihao19/artemis"},{"title":"dinhvietcuong1996/icme25-inova","url":"https://github.com/dinhvietcuong1996/icme25-inova"}],"metrics_order":"[\"Total Column Score\"]","area":"Computer Vision","uses_additional_data":1,"source":"archive","tags":[]},{"id":149000,"task":"MMR total","parent_task":null,"dataset":"MRR-Benchmark","model_name":"Qwen-vl-plus","metrics":{"Total Column Score":"310"},"paper_url":"https://arxiv.org/abs/2308.12966v3","paper_title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","paper_date":"2023-08-24","code_links":[{"title":"qwenlm/qwen-vl","url":"https://github.com/qwenlm/qwen-vl"},{"title":"brandon3964/multimodal-task-vector","url":"https://github.com/brandon3964/multimodal-task-vector"}],"metrics_order":"[\"Total Column Score\"]","area":"Computer Vision","uses_additional_data":1,"source":"archive","tags":[]},{"id":149001,"task":"MMR total","parent_task":null,"dataset":"MRR-Benchmark","model_name":"Idefics-2-8B","metrics":{"Total Column Score":"256"},"paper_url":"https://arxiv.org/abs/2405.02246v1","paper_title":"What matters when building vision-language models?","paper_date":"2024-05-03","code_links":[],"metrics_order":"[\"Total Column Score\"]","area":"Computer Vision","uses_additional_data":1,"source":"archive","tags":[]},{"id":149002,"task":"MMR total","parent_task":null,"dataset":"MRR-Benchmark","model_name":"LLaVA-1.5-13B","metrics":{"Total Column Score":"243"},"paper_url":"https://arxiv.org/abs/2304.08485v2","paper_title":"Visual Instruction Tuning","paper_date":"2023-04-17","code_links":[{"title":"huggingface/transformers","url":"https://github.com/huggingface/transformers"},{"title":"haotian-liu/LLaVA","url":"https://github.com/haotian-liu/LLaVA"},{"title":"LLaVA-VL/LLaVA-NeXT","url":"https://github.com/LLaVA-VL/LLaVA-NeXT"},{"title":"computer-vision-in-the-wild/cvinw_readings","url":"https://github.com/computer-vision-in-the-wild/cvinw_readings"},{"title":"skunkworksai/bakllava","url":"https://github.com/skunkworksai/bakllava"},{"title":"tabtoyou/kollava","url":"https://github.com/tabtoyou/kollava"},{"title":"camenduru/llava-colab","url":"https://github.com/camenduru/llava-colab"},{"title":"sshh12/multi_token","url":"https://github.com/sshh12/multi_token"},{"title":"sunsmarterjie/chatterbox","url":"https://github.com/sunsmarterjie/chatterbox"},{"title":"ZhangYiqun018/StickerConv","url":"https://github.com/ZhangYiqun018/StickerConv"},{"title":"llava-annonymous/llava","url":"https://github.com/llava-annonymous/llava"},{"title":"qiujihao19/artemis","url":"https://github.com/qiujihao19/artemis"},{"title":"dinhvietcuong1996/icme25-inova","url":"https://github.com/dinhvietcuong1996/icme25-inova"}],"metrics_order":"[\"Total Column Score\"]","area":"Computer Vision","uses_additional_data":1,"source":"archive","tags":[]},{"id":149003,"task":"MMR total","parent_task":null,"dataset":"MRR-Benchmark","model_name":"InternVL2-1B","metrics":{"Total Column Score":"237"},"paper_url":"https://arxiv.org/abs/2312.14238v3","paper_title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","paper_date":"2023-12-21","code_links":[{"title":"opengvlab/internvl","url":"https://github.com/opengvlab/internvl"},{"title":"opengvlab/internvl-mmdetseg","url":"https://github.com/opengvlab/internvl-mmdetseg"}],"metrics_order":"[\"Total Column Score\"]","area":"Computer Vision","uses_additional_data":1,"source":"archive","tags":[]},{"id":149004,"task":"MMR total","parent_task":null,"dataset":"MRR-Benchmark","model_name":"Monkey-Chat-7B","metrics":{"Total Column Score":"214"},"paper_url":"https://arxiv.org/abs/2311.06607v4","paper_title":"Monkey: Image Resolution and Text Label Are Important Things for Large Multi-modal Models","paper_date":"2023-11-11","code_links":[{"title":"yuliang-liu/monkey","url":"https://github.com/yuliang-liu/monkey"}],"metrics_order":"[\"Total Column Score\"]","area":"Computer Vision","uses_additional_data":1,"source":"archive","tags":[]},{"id":149005,"task":"MMR total","parent_task":null,"dataset":"MRR-Benchmark","model_name":"Idefics-80B","metrics":{"Total Column Score":"139"},"paper_url":"https://arxiv.org/abs/2306.16527v2","paper_title":"OBELICS: An Open Web-Scale Filtered Dataset of Interleaved Image-Text Documents","paper_date":"2023-06-21","code_links":[{"title":"huggingface/obelics","url":"https://github.com/huggingface/obelics"},{"title":"MindSpore-scientific-2/code-14","url":"https://github.com/MindSpore-scientific-2/code-14/tree/main/idefics"}],"metrics_order":"[\"Total Column Score\"]","area":"Computer Vision","uses_additional_data":1,"source":"archive","tags":[]}]}