@inproceedings{embodiedsceneunderstandingforvision, title = {Embodied Scene Understanding for Vision Language Models via MetaVQA}, author = {Weizhen Wang and Chenda Duan and Zhenghao Peng and Yuxin Liu and Bolei Zhou}, year = {2025}, booktitle = {CVPR 2025 1}, eprint = {2501.09167}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2501.09167v1}, }