paper-with-me

홈 › Papers

DynRsl-VLM: Enhancing Autonomous Driving Perception with Dynamic Resolution Vision-Language Models

2025-03-14 · Xirui Zhou, Lianlei Shan, Xiaolin Gui

Visual Question Answering (VQA) models, which fall under the category of vision-language models, conventionally execute multiple downsampling processes on image inputs to strike a balance between computational efficiency and model performance. Although this approach aids in concentrating on salient features and diminishing computational burden, it incurs the loss of vital detailed information, a drawback that is particularly damaging in end-to-end autonomous driving scenarios. Downsampling can lead to an inadequate capture of distant or small objects such as pedestrians, road signs, or obstacles, all of which are crucial for safe navigation. This loss of features negatively impacts an autonomous driving system's capacity to accurately perceive the environment, potentially escalating the risk of accidents. To tackle this problem, we put forward the Dynamic Resolution Vision Language Model (DynRsl-VLM). DynRsl-VLM incorporates a dynamic resolution image input processing approach that captures all entity feature information within an image while ensuring that the image input remains computationally tractable for the Vision Transformer (ViT). Moreover, we devise a novel image-text alignment module to replace the Q-Former, enabling simple and efficient alignment with text when dealing with dynamic resolution image inputs. Our method enhances the environmental perception capabilities of autonomous driving systems without overstepping computational constraints.

📄 PDF Abstract BibTeX arXiv:2503.11265

Code (0)

등록된 구현이 없습니다.

Tasks

Autonomous DrivingComputational EfficiencyQuestion AnsweringVisual Question AnsweringVisual Question Answering (VQA)

Methods 이 논문이 사용한 방법론

Linear Layer A Linear Layer is a projection $\mathbf{XW + b}$.
Multi-Head Attention 설명 없음
BPE Byte Pair Encoding, or BPE, is a subword segmentation algorithm that encodes rare and unknown words as sequences of subword units. The intuition is that various word…
Dense Connections Dense Connections, or Fully Connected Connections, are a type of layer in a deep neural network that use a linear operation where every input is connected to every output…
Absolute Position Encodings Absolute Position Encodings are a type of position embeddings for [Transformer-based models] where positional encodings are…
Dropout Dropout is a regularization technique for neural networks that drops a unit (along with connections) at training time with a specified probability $p$ (a common value is…
Residual Connection 설명 없음
Position-Wise Feed-Forward Layer 설명 없음

Similar Papers 제목 키워드 기반

Combating Partial Perception Deficit in Autonomous Driving with Multimodal LLM Commonsense

2025-03-10 · Yuting Hu, Chenhui Xu, Ruiyang Qin, Dancheng Liu 외

Partial perception deficits can compromise autonomous vehicle safety by disrupting environmental understanding. Current protocols typically respond with immediate stops or minimal-risk maneuvers, worsening traffic flow a…

Autonomous DrivingMotion Planning

Advancing Autonomous Driving Perception: Analysis of Sensor Fusion and Computer Vision Techniques

2024-11-15 · Urvishkumar Bharti, Vikram Shahapur

In autonomous driving, perception systems are piv otal as they interpret sensory data to understand the envi ronment, which is essential for decision-making and planning. Ensuring the safety of these perception systems i…

Autonomous DrivingDecision MakingSensor Fusion

Unified End-to-End V2X Cooperative Autonomous Driving

2024-05-07 · Zhiwei Li, Bozhen Zhang, Lei Yang, Tianyu Shen 외

V2X cooperation, through the integration of sensor data from both vehicles and infrastructure, is considered a pivotal approach to advancing autonomous driving technology. Current research primarily focuses on enhancing …

Autonomous Drivingmotion prediction

Leveraging Large Language Models for Enhancing Autonomous Vehicle Perception

2024-12-28 · Athanasios Karagounis

Autonomous vehicles (AVs) rely on sophisticated perception systems to interpret their surroundings, a cornerstone for safe navigation and decision-making. The integration of Large Language Models (LLMs) into AV perceptio…

Autonomous DrivingAutonomous VehiclesDecision MakingSensor Fusion

World knowledge-enhanced Reasoning Using Instruction-guided Interactor in Autonomous Driving

2024-12-09 · Mingliang Zhai, Cheng Li, Zengyuan Guo, Ningrui Yang 외

The Multi-modal Large Language Models (MLLMs) with extensive world knowledge have revitalized autonomous driving, particularly in reasoning tasks within perceivable regions. However, when faced with perception-limited ar…

Autonomous DrivingWorld Knowledge