@article{otteravisionlanguageactionmodelwith, title = {OTTER: A Vision-Language-Action Model with Text-Aware Visual Feature Extraction}, author = {Huang Huang and Fangchen Liu and Letian Fu and Tingfan Wu and Mustafa Mukadam and Jitendra Malik and Ken Goldberg and Pieter Abbeel}, year = {2025}, eprint = {2503.03734}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2503.03734v3}, }