paper-with-me

홈 › Papers

Vision-Language-Action Models for Autonomous Driving: Past, Present, and Future

2025-12-18 · Tianshuai Hu, Xiaolu Liu, Song Wang, Yiyao Zhu, Ao Liang, Lingdong Kong, Guoyang Zhao, Zeying Gong, Jun Cen, Zhiyu Huang, Xiaoshuai Hao, Linfeng Li, Hang Song, Xiangtai Li, Jun Ma, Shaojie Shen, Jianke Zhu, Dacheng Tao, Ziwei Liu, Junwei Liang arxiv

Autonomous driving has long relied on modular "Perception-Decision-Action" pipelines, where hand-crafted interfaces and rule-based components often break down in complex or long-tailed scenarios. Their cascaded design further propagates perception errors, degrading downstream planning and control. Vision-Action (VA) models address some limitations by learning direct mappings from visual inputs to actions, but they remain opaque, sensitive to distribution shifts, and lack structured reasoning or instruction-following capabilities. Recent progress in Large Language Models (LLMs) and multimodal learning has motivated the emergence of Vision-Language-Action (VLA) frameworks, which integrate perception with language-grounded decision making. By unifying visual understanding, linguistic reasoning, and actionable outputs, VLAs offer a pathway toward more interpretable, generalizable, and human-aligned driving policies. This work provides a structured characterization of the emerging VLA landscape for autonomous driving. We trace the evolution from early VA approaches to modern VLA frameworks and organize existing methods into two principal paradigms: End-to-End VLA, which integrates perception, reasoning, and planning within a single model, and Dual-System VLA, which separates slow deliberation (via VLMs) from fast, safety-critical execution (via planners). Within these paradigms, we further distinguish subclasses such as textual vs. numerical action generators and explicit vs. implicit guidance mechanisms. We also summarize representative datasets and benchmarks for evaluating VLA-based driving systems and highlight key challenges and open directions, including robustness, interpretability, and instruction fidelity. Overall, this work aims to establish a coherent foundation for advancing human-compatible autonomous driving systems.

📄 PDF Abstract BibTeX arXiv:2512.16760

Code (0)

등록된 구현이 없습니다.

Tasks

Autonomous DrivingDecision Making

Similar Papers 제목 키워드 기반

CoVLA: Comprehensive Vision-Language-Action Dataset for Autonomous Driving

2024-08-19 · Hidehisa Arai, Keita Miwa, Kento Sasaki, Yu Yamaguchi 외

Autonomous driving, particularly navigating complex and unanticipated scenarios, demands sophisticated reasoning and planning capabilities. While Multi-modal Large Language Models (MLLMs) offer a promising avenue for thi…

Autonomous DrivingCaption GenerationVision-Language-Action

SimLingo: Vision-Only Closed-Loop Autonomous Driving with Language-Action Alignment

2025-03-12 · CVPR 2025 1 · Katrin Renz, Long Chen, Elahe Arani, Oleg Sinavski

Integrating large language models (LLMs) into autonomous driving has attracted significant attention with the hope of improving generalization and explainability. However, existing methods often focus on either driving o…

Autonomous DrivingBench2DriveLanguage ModelingLanguage Modelling+2

DriveAction: A Benchmark for Exploring Human-like Driving Decisions in VLA Models

2025-06-06 · Yuhan Hao, Zhengning Li, Lei Sun, Weilong Wang 외

Vision-Language-Action (VLA) models have advanced autonomous driving, but existing benchmarks still lack scenario diversity, reliable action-level annotation, and evaluation protocols aligned with human preferences. To a…

Autonomous DrivingAutonomous VehiclesVision-Language-Action

OpenDriveVLA: Towards End-to-end Autonomous Driving with Large Vision Language Action Model

2025-03-30 · Xingcheng Zhou, Xuyuan Han, Feng Yang, Yunpu Ma 외

We present OpenDriveVLA, a Vision-Language Action (VLA) model designed for end-to-end autonomous driving. OpenDriveVLA builds upon open-source pre-trained large Vision-Language Models (VLMs) to generate reliable driving …

Autonomous DrivingDecision MakingMotion PlanningQuestion Answering+4

VLA-R: Vision-Language Action Retrieval toward Open-World End-to-End Autonomous Driving

2025-11-16 · Hyunki Seong, Seongwoo Moon, Hojin Ahn, Jehun Kang 외 arxiv

Exploring open-world situations in an end-to-end manner is a promising yet challenging task due to the need for strong generalization capabilities. In particular, end-to-end autonomous driving in unstructured outdoor env…

Contrastive LearningAutonomous Driving