paper-with-me

Vision and Language Navigation 벤치마크

Vision and Language Navigation on RxR

6개 결과 · ⬇ CSV · JSON

ndtw

36.81 44.3 51.79 59.27 66.76 2020-10 2026-09 Monolingual Baseline — 41.05 (2020-10-15) Multilingual Baseline — 36.81 (2020-10-15) CLEAR-CLIP — 53.69 (2021-07-13) HAMT — 59.94 (2021-10-25) EnvEdit-PT — 64.61 (2022-03-29) MARVAL — 66.76 (2022-10-06) Monolingual Baseline — 41.05 (2020-10-15) CLEAR-CLIP — 53.69 (2021-07-13) HAMT — 59.94 (2021-10-25) EnvEdit-PT — 64.61 (2022-03-29) MARVAL — 66.76 (2022-10-06)
RankModel ndtw Extra Training Data PaperCodeYear
1 MARVAL 66.76 A New Path: Scaling Vision-and-Language Navigation with Synthetic Instructions and Imitation Learning 2022
2 EnvEdit-PT 64.61 EnvEdit: Environment Editing for Vision-and-Language Navigation jialuli-luka/envedit 2022
3 HAMT 59.94 History Aware Multimodal Transformer for Vision-and-Language Navigation cshizhe/vln-hamt 2021
4 CLEAR-CLIP 53.69 How Much Can CLIP Benefit Vision-and-Language Tasks? clip-vil/CLIP-ViL · jianjieluo/openai-clip-feature · facebookresearch/reliable_vqa · +1 2021
5 Monolingual Baseline 41.05 Room-Across-Room: Multilingual Vision-and-Language Navigation with Dense Spatiotemporal Grounding jacobkrantz/VLN-CE · google-research-datasets/RxR · VegB/Diagnose_VLN 2020
6 Multilingual Baseline 36.81 Room-Across-Room: Multilingual Vision-and-Language Navigation with Dense Spatiotemporal Grounding jacobkrantz/VLN-CE · google-research-datasets/RxR · VegB/Diagnose_VLN 2020
1–6 / 6 페이지당 10 20 50 100