@article{visualembodiedbrainletmultimodallarge, title = {Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces}, author = {Gen Luo and Ganlin Yang and Ziyang Gong and Guanzhou Chen and Haonan Duan and Erfei Cui and Ronglei Tong and Zhi Hou and Tianyi Zhang and Zhe Chen and Shenglong Ye and Lewei Lu and Jingbo Wang and Wenhai Wang and Jifeng Dai and Yu Qiao and Rongrong Ji and Xizhou Zhu}, year = {2025}, eprint = {2506.00123}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2506.00123v1}, }