paper-with-me

3D dense captioning

2개 벤치마크 · 논문 33편 · 이 태스크의 논문 보기 →

Benchmarks

ScanRefer Dataset

결과 12개

Nr3D

결과 10개

Most implemented

Papers

3D-Aware VLMs with Implicit and Explicit Geometries

2026-07-23 · Wenhao Li, Xueying Jiang, Quanhao Qian, Deli Zhao 외 arxiv

Despite rapid progress, most existing vision-language models (VLMs) built from 2D visual inputs often struggle when handling various 3D tasks that require fine-grained spatial understanding and reasoning. To bridge this …

3D dense captioningSpatial ReasoningVisual Grounding

PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet

2026-07-07 · Xiaopei Wu, Chenshu Hou, Liang Peng, Dan Xu 외 arxiv

3D dense captioning, an emerging vision-language task, aims to generate descriptive sentences for each object in the 3D scene. Despite the impressive results achieved by previous methods, they suffer from two limitations…

3D dense captioningData Augmentation

Occ-VLM: Occupancy Grounded Vision Language Model for Indoor Scene Understanding

2026-06-18 · Jianing Li, Zhou Fang, Yijiang Liu, Li Du arxiv

Recently, vision-language models (VLMs) have made significant progress in 3D scene understanding, driving advances in applications such as embodied intelligence and robotic vision. However, existing approaches typically …

Visual Question Answering3D dense captioningScene UnderstandingPoint Clouds

GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models

2026-03-17 · Jiaxin Zhang, Junjun Jiang, Haijie Li, Youyu Chen 외 arxiv

Multimodal Large Language Models (MLLMs) demonstrate exceptional semantic reasoning but struggle with 3D spatial perception when restricted to pure RGB inputs. Despite leveraging implicit geometric priors from 3D reconst…

Video Object Detection3D dense captioning3D ReconstructionVisual Grounding

Scenes as Tokens: Multi-Scale Normal Distributions Transform Tokenizer for General 3D Vision-Language Understanding

2025-11-26 · Yutao Tang, Cheng Zhao, Gaurav Mittal, Rohith Kukkala 외 arxiv

Recent advances in 3D vision-language models (VLMs) highlight a strong potential for 3D scene understanding and reasoning. However, effectively tokenizing 3D scenes into holistic scene tokens, and leveraging these tokens…

Visual Question Answering3D dense captioningScene UnderstandingPoint Clouds

Vid-LLM: A Compact Video-based 3D Multimodal LLM with Reconstruction-Reasoning Synergy

2025-09-29 · Haijier Chen, Bo Xu, Shoujian Zhang, Haoze Liu 외 arxiv

Recent developments in Multimodal Large Language Models (MLLMs) have significantly improved Vision-Language (VL) reasoning in 2D domains. However, extending these capabilities to 3D scene understanding remains a major ch…

3D dense captioningScene UnderstandingQuestion AnsweringVisual Grounding

전체 33편 보기 →