paper-with-me

Papers

Collision-Aware Vision-Language Learning for End-to-End Driving with Multimodal Infraction Datasets

2026-03-26 · Alex Koran, Dimitrios Sinodinos, Hadi Hojjati, Takuya Nanri, Fangge Chen, Narges Armanfard arxiv

High infraction rates remain the primary bottleneck for end-to-end (E2E) autonomous driving, as evidenced by the low driving scores on the CARLA Leaderboard. Despite collision-related infractions being the dominant failure mode in closed-loop evaluations, collision-aware representation learning has received limited attention. To address this gap, we first develop a Video-Language-Augmented Anomaly Detector (VLAAD), leveraging a Multiple Instance Learning (MIL) formulation to obtain stable, temporally localized collision signals for proactive prediction. To transition these capabilities into closed-loop simulations, we must overcome the limitations of existing simulator datasets, which lack multimodality and are frequently restricted to simple intersection scenarios. Therefore, we introduce CARLA-Collide, a large-scale multimodal dataset capturing realistic collision events across highly diverse road networks. Trained on this diverse simulator data, VLAAD serves as a collision-aware plug-in module that can be seamlessly integrated into existing E2E driving models. By integrating our module into a pretrained TransFuser++ agent, we demonstrate a 14.12% relative increase in driving score with minimal fine-tuning. Beyond closed-loop evaluation, we further assess the generalization capability of VLAAD in an open-loop setting using real-world driving data. To support this analysis, we introduce Real-Collide, a multimodal dataset of diverse dashcam videos paired with semantically rich annotations for collision detection and prediction. On this benchmark, despite containing only 0.6B parameters, VLAAD outperforms a multi-billion-parameter vision-language model, achieving a 23.3% improvement in AUC.

📄 PDF Abstract BibTeX arXiv:2603.25946

Code (0)

등록된 구현이 없습니다.

Tasks

Multiple Instance LearningRepresentation LearningAutonomous Driving

Similar Papers 제목 키워드 기반

StyleVLA: Driving Style-Aware Vision Language Action Model for Autonomous Driving

2026-03-10 · Yuan Gao, Dengyuan Hua, Mattia Piccinini, Finn Rasmus Schäfer 외 arxiv

Vision Language Models (VLMs) bridge visual perception and linguistic reasoning. In Autonomous Driving (AD), this synergy has enabled Vision Language Action (VLA) models, which translate high-level multimodal understandi…

Collision AvoidanceAutonomous Driving

VLM-AutoDrive: Post-Training Vision-Language Models for Safety-Critical Autonomous Driving Events

2026-03-18 · Mohammad Qazim Bhat, Yufan Huang, Niket Agarwal, Hao Wang 외 arxiv

The rapid growth of ego-centric dashcam footage presents a major challenge for detecting safety-critical events such as collisions and near-collisions, scenarios that are brief, rare, and difficult for generic vision mod…

Visual Question AnsweringAutonomous DrivingAnomaly Detection

Listen, Look, Drive: Coupling Audio Instructions for User-aware VLA-based Autonomous Driving

2026-01-17 · Ziang Guo, Feng Yang, Xuefeng Zhang, Jiaqi Guo 외 arxiv

Vision Language Action (VLA) models promise an open-vocabulary interface that can translate perceptual ambiguity into semantically grounded driving decisions, yet they still treat language as a static prior fixed at infe…

Autonomous Driving

Enhancing Multimodal Large Language Models for Safety-Critical Driving Video Analysis

2026-05-21 · Tomaso Trinci, Henrique Piñeiro Monteagudo, Leonardo Taccari arxiv

Recent advancements in Multimodal Large Language Models (MLLMs) have demonstrated impressive capabilities in general visual understanding. However, their application to safety-critical driving scenarios remains limited b…

LAD-Drive: Bridging Language and Trajectory with Action-Aware Diffusion Transformers

2026-03-02 · Fabian Schmidt, Karol Fedurko, Markus Enzweiler, Abhinav Valada arxiv

While multimodal large language models (MLLMs) provide advanced reasoning for autonomous driving, translating their discrete semantic knowledge into continuous trajectories remains a fundamental challenge. Existing metho…

Autonomous Driving