paper-with-me

홈 › Papers

OptiSight: Bridging Semantic Reasoning and Geometric Control for Embodied Navigation

2026-08-24 · Alperen Avan, Jordi Sanchez-Riera arxiv

Autonomous indoor navigation requires both semantic understanding and precise geometric control. We propose OptiSight, a hybrid framework that combines Vision-Language Model reasoning with deterministic visual servoing through a finite-state Chain-of-Thought architecture. Grounded-SAM localizes open-vocabulary targets, while camera projection geometry converts visual observations into navigation commands without requiring dense mapping. The VLM is queried only at key decision points, reducing computational overhead while geometric control handles continuous navigation. Experiments in AI Habitat demonstrate reliable zero-shot navigation across diverse indoor scenarios, including obstacle avoidance and semantic ambiguity, while operating within an 8~GB VRAM budget. The source code is available at https://github.com/avanalperen/OptiSight-Python-Multimodal-CoT-for-Visual-Reasoning.

📄 PDF Abstract BibTeX arXiv:2608.23354

Code (0)

등록된 구현이 없습니다.

Similar Papers 제목 키워드 기반

BLaDA: Bridging Language to Functional Dexterous Actions within 3DGS Fields

2026-04-09 · Fan Yang, Wenrui Chen, Guorun Yan, Ruize Liao 외 arxiv

In unstructured environments, functional dexterous grasping calls for the tight integration of semantic understanding, precise 3D functional localization, and physically interpretable execution. Modular hierarchical meth…

Spatial Reasoning

Bridging Semantics and Geometry: A Decoupled LVLM-SAM Framework for Reasoning Segmentation in Optical Remote Sensing

2025-12-22 · Xu Zhang, Junyao Ge, Yang Zheng, Kaitai Guo 외 arxiv

Large Vision--Language Models (LVLMs) hold great promise for advancing optical remote sensing (RS) analysis, yet existing reasoning segmentation frameworks couple linguistic reasoning and pixel prediction through end-to-…

Reinforcement Learning

Semantic Bridge: Universal Multi-Hop Question Generation via AMR-Driven Graph Synthesis

2025-08-06 · Linqing Chen, Hanmeng Zhong, Wentao Wu, Weilei Wang arxiv

Large language model (LLM) training faces a critical bottleneck: the scarcity of high-quality, reasoning-intensive question-answer pairs, especially from sparse, domain-specific sources like PubMed papers or legal docume…

Question Generation

Bridging Viewpoint Gaps: Geometric Reasoning Boosts Semantic Correspondence

2025-01-01 · CVPR 2025 1 · Qiyang Qian, Hansheng Chen, Masayoshi Tomizuka, Kurt Keutzer 외

Finding semantic correspondences between images is a challenging problem in computer vision, particularly under significant viewpoint changes. Previous methods rely on semantic features from pre-trained 2D models lik…

Geometric MatchingSemantic correspondence

Vision-Language Models for Deployable Social Robot Navigation: Bridging Semantic Reasoning and Low-Level Control

2026-06-27 · Runji Cai, Toshihiko Yamasaki, Ling Xiao arxiv

Social robot navigation (SRN) requires more than geometric path planning; it demands understanding human intentions, social norms, and contextual cues to generate socially compliant behaviors. Although classical navigati…

Collision AvoidanceRobot Navigation