paper-with-me

홈 › Papers

WaterVideoQA: ASV-Centric Perception and Rule-Compliant Reasoning via Multi-Modal Agents

2026-02-26 · Runwei Guan, Shaofeng Liang, Ningwei Ouyang, Weichen Fei, Shanliang Yao, Wei Dai, Chenhao Ge, Penglei Sun, Xiaohui Zhu, Tao Huang, Ryan Wen Liu, Hui Xiong arxiv

While autonomous navigation has achieved remarkable success in passive perception (e.g., object detection and segmentation), it remains fundamentally constrained by a void in knowledge-driven, interactive environmental cognition. In the high-stakes domain of maritime navigation, the ability to bridge the gap between raw visual perception and complex cognitive reasoning is not merely an enhancement but a critical prerequisite for Autonomous Surface Vessels to execute safe and precise maneuvers. To this end, we present WaterVideoQA, the first large-scale, comprehensive Video Question Answering benchmark specifically engineered for all-waterway environments. This benchmark encompasses 3,029 video clips across six distinct waterway categories, integrating multifaceted variables such as volatile lighting and dynamic weather to rigorously stress-test ASV capabilities across a five-tier hierarchical cognitive framework. Furthermore, we introduce NaviMind, a pioneering multi-agent neuro-symbolic system designed for open-ended maritime reasoning. By synergizing Adaptive Semantic Routing, Situation-Aware Hierarchical Reasoning, and Autonomous Self-Reflective Verification, NaviMind transitions ASVs from superficial pattern matching to regulation-compliant, interpretable decision-making. Experimental results demonstrate that our framework significantly transcends existing baselines, establishing a new paradigm for intelligent, trustworthy interaction in dynamic maritime environments.

📄 PDF Abstract BibTeX arXiv:2602.22923

Code (0)

등록된 구현이 없습니다.

Tasks

Video Question AnsweringObject Detection

Similar Papers 제목 키워드 기반

Social-LLaVA: Enhancing Robot Navigation through Human-Language Reasoning in Social Spaces

2024-12-30 · Amirreza Payandeh, Daeun Song, Mohammad Nazeri, Jing Liang 외

Most existing social robot navigation techniques either leverage hand-crafted rules or human demonstrations to connect robot perception to socially compliant actions. However, there remains a significant gap in effective…

2kRobot NavigationVisual Question Answering (VQA)

Rule-Compliant Visual Spatial Planning for Multimodal Large Language Models

2026-08-20 · Yu Chen, Ting Lei, Yaoyi Li, Jia Cai 외 arxiv

Multimodal large language models (MLLMs) combine linguistic reasoning with visual perception, yet their ability to perform visual spatial planning under explicit or previously unseen rule constraints remains underexplore…

MUSON: A Reasoning-oriented Multimodal Dataset for Socially Compliant Navigation in Urban Environments

2025-12-28 · Zhuonan Liu, Xinyu Zhang, Zishuo Wang, Runji Cai 외 arxiv

Socially compliant navigation requires structured reasoning about dynamic pedestrians and physical constraints to ensure safe and interpretable decisions. Vision-language models (VLMs) provide a promising foundation for …

Weakly Supervised Concept Learning for Object-centric Visual Reasoning

2026-05-05 · Sparsh Tiwari, Bettina Finzel, Gesina Schwalbe arxiv

Neurosymbolic systems promise to combine deep neural network's (DNN) processing of raw sensor inputs with few-shot performance of symbolic artificial intelligence. Two-stage approaches explicitly decouple DNN based perce…

Inductive logic programmingDomain GeneralizationVisual Reasoning

Artemis: Structured Visual Reasoning for Perception Policy Learning

2025-12-01 · Wei Tang, Yanpeng Sun, Shan Zhang, Weihao Bo 외 arxiv

Recent reinforcement-learning frameworks for visual perception policy usually incorporate intermediate reasoning chains expressed in natural language. Empirical observations indicate that such purely linguistic intermedi…

Visual Reasoning