paper-with-me

Papers

ReasonDrive: Efficient Visual Question Answering for Autonomous Vehicles with Reasoning-Enhanced Small Vision-Language Models

2025-04-14 · Amirhosein Chahe, Lifeng Zhou

Vision-language models (VLMs) show promise for autonomous driving but often lack transparent reasoning capabilities that are critical for safety. We investigate whether explicitly modeling reasoning during fine-tuning enhances VLM performance on driving decision tasks. Using GPT-4o, we generate structured reasoning chains for driving scenarios from the DriveLM benchmark with category-specific prompting strategies. We compare reasoning-based fine-tuning, answer-only fine-tuning, and baseline instruction-tuned models across multiple small VLM families (Llama 3.2, Llava 1.5, and Qwen 2.5VL). Our results demonstrate that reasoning-based fine-tuning consistently outperforms alternatives, with Llama3.2-11B-reason achieving the highest performance. Models fine-tuned with reasoning show substantial improvements in accuracy and text generation quality, suggesting explicit reasoning enhances internal representations for driving decisions. These findings highlight the importance of transparent decision processes in safety-critical domains and offer a promising direction for developing more interpretable autonomous driving systems.

📄 PDF Abstract BibTeX arXiv:2504.10757

Code (1)

zhourobotics/reasondrive 공식 구현 pytorch

Tasks

Autonomous DrivingAutonomous VehiclesQuestion AnsweringText GenerationVisual Question Answering

Similar Papers 제목 키워드 기반

Explaining Autonomous Driving Actions with Visual Question Answering

2023-07-19 · Shahin Atakishiyev, Mohammad Salameh, Housam Babiker, Randy Goebel

The end-to-end learning ability of self-driving vehicles has achieved significant milestones over the last decade owing to rapid advances in deep learning and computer vision algorithms. However, as autonomous driving te…

Autonomous DrivingAutonomous VehiclesDecision MakingQuestion Answering+3

LAVQA: A Latency-Aware Visual Question Answering Framework for Shared Autonomy in Self-Driving Vehicles

2025-11-14 · Shuangyu Xie, Kaiyuan Chen, Wenjing Chen, Chengyuan Qian 외 arxiv

When uncertainty is high, self-driving vehicles may halt for safety and benefit from the access to remote human operators who can provide high-level guidance. This paradigm, known as {shared autonomy}, enables autonomous…

Visual Question Answering

Efficient Visual Question Answering Pipeline for Autonomous Driving via Scene Region Compression

2026-01-11 · Yuliang Cai, Dongqiangzi Ye, Zitian Chen, Chongruo Wu arxiv

Autonomous driving increasingly relies on Visual Question Answering (VQA) to enable vehicles to understand complex surroundings by analyzing visual inputs and textual queries. Currently, a paramount concern for VQA in th…

Visual Question AnsweringVideo Question AnsweringComputational EfficiencyAutonomous Driving

Optimizing Visual Question Answering Models for Driving: Bridging the Gap Between Human and Machine Attention Patterns

2024-06-13 · Kaavya Rekanar, Martin Hayes, Ganesh Sistu, Ciaran Eising

Visual Question Answering (VQA) models play a critical role in enhancing the perception capabilities of autonomous driving systems by allowing vehicles to analyze visual inputs alongside textual queries, fostering natura…

Autonomous DrivingQuestion AnsweringVisual Question AnsweringVisual Question Answering (VQA)

Modeling Perception Errors towards Robust Decision Making in Autonomous Vehicles

2020-01-31 · Andrea Piazzoni, Jim Cherian, Martin Slavik, Justin Dauwels

Sensing and Perception (S&P) is a crucial component of an autonomous system (such as a robot), especially when deployed in highly dynamic environments where it is required to react to unexpected situations. This is parti…

Autonomous VehiclesDecision Making