@article{mtamultimodaltaskalignmentforbev, title = {MTA: Multimodal Task Alignment for BEV Perception and Captioning}, author = {Yunsheng Ma and Burhaneddin Yaman and Xin Ye and Feng Tao and Abhirup Mallik and Ziran Wang and Liu Ren}, year = {2024}, eprint = {2411.10639}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2411.10639v1}, }