paper-with-me

홈 › Papers

Overcoming Visual Clutter in Vision Language Action Models via Concept-Gated Visual Distillation

2026-03-11 · Sangmim Song, Sarath Kodagoda, Marc Carmichael, Karthick Thiyagarajan arxiv

Vision-Language-Action (VLA) models demonstrate impressive zero-shot generalization but frequently suffer from a "Precision-Reasoning Gap" in cluttered environments. This failure is driven by background-induced feature dilution, where high-frequency semantic noise corrupts the geometric grounding required for precise manipulation. To bridge this gap, we propose Concept-Gated Visual Distillation (CGVD), a training-free, model-agnostic inference framework that stabilizes VLA policies. CGVD operates by parsing instructions into safe and distractor sets, utilizing a two-layer target refinement process--combining cross-validation and spatial disambiguation--to explicitly penalize false positives and isolate genuine manipulation targets. We then process the scene via Fourier-based inpainting, generating a clean observation that actively suppresses semantic distractors while preserving critical spatial geometry and visual proprioception. Extensive evaluations in highly cluttered manipulation tasks demonstrate that CGVD prevents performance collapse. In environments with dense semantic distractors, our method significantly outperforms state-of-the-art baselines, achieving a 77.5% success rate compared to the baseline's 43.0%. By enforcing strict attribute adherence, CGVD establishes inference-time visual distillation as a critical prerequisite for robust robotic manipulation in the clutter.

📄 PDF Abstract BibTeX arXiv:2603.10340

Code (0)

등록된 구현이 없습니다.

Tasks

Zero-shot Generalization

Similar Papers 제목 키워드 기반

HSC-VLA: Hierarchical Scene-Clearing for Robust Bimanual Manipulation in Dense Clutter

2026-03-08 · Zhen Liu, Xinyu Ning, Zhe Hu, XinXin Xie 외 arxiv

Modern Vision--Language--Action models often suffer from critical instruction-following failures in high-density manipulation environments, where task-irrelevant visual clutter dilutes attention, corrupts grounding, and …

Point What You Mean: Visually Grounded Instruction Policy

2025-12-22 · Hang Yu, Juntu Zhao, Yufeng Liu, Kaiyu Li 외 arxiv

Vision-Language-Action (VLA) models align vision and language with embodied control, but their object referring ability remains limited when relying solely on text prompt, especially in cluttered or out-of-distribution (…

Visual Grounding

AdaClearGrasp: Learning Adaptive Clearing for Zero-Shot Robust Dexterous Grasping in Densely Cluttered Environments

2026-03-11 · Zixuan Chen, Wenquan Zhang, Jing Fang, Ruiming Zeng 외 arxiv

In densely cluttered environments, physical interference, visual occlusions, and unstable contacts often cause direct dexterous grasping to fail, while aggressive singulation strategies may compromise safety. Enabling ro…

Zero-shot GeneralizationReinforcement Learning

Action-Sketcher: From Reasoning to Action via Visual Sketches for Long-Horizon Robotic Manipulation

2026-01-04 · Huajie Tan, Peterson Co, Yijie Xu, Shanyu Rong 외 arxiv

Long-horizon robotic manipulation is increasingly important for real-world deployment, requiring spatial disambiguation in complex layouts and temporal resilience under dynamic interaction. However, existing end-to-end a…

Efficient Alignment of Unconditioned Action Prior for Language-conditioned Pick and Place in Clutter

2025-03-12 · Kechun Xu, Xunlong Xia, Kaixuan Wang, Yifei Yang 외

We study the task of language-conditioned pick and place in clutter, where a robot should grasp a target object in open clutter and move it to a specified place. Some approaches learn end-to-end policies with features fr…

Zero-shot Generalization