@article{vocotunleashingvisuallygroundedmultistep, title = {VoCoT: Unleashing Visually Grounded Multi-Step Reasoning in Large Multi-Modal Models}, author = {Zejun Li and Ruipu Luo and Jiwen Zhang and Minghui Qiu and Zhongyu Wei}, year = {2024}, eprint = {2405.16919}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2405.16919v2}, }