@article{legocobuilderexploringfinegrainedvisionl, title = {LEGO Co-builder: Exploring Fine-Grained Vision-Language Modeling for Multimodal LEGO Assembly Assistants}, author = {Haochen Huang and Jiahuan Pei and Mohammad Aliannejadi and Xin Sun and Moonisa Ahsan and Chuang Yu and Zhaochun Ren and Pablo Cesar and Junxiao Wang}, year = {2025}, eprint = {2507.05515}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2507.05515}, }