@article{visionasinversegraphicsagentviainterleav, title = {Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning}, author = {Shaofeng Yin and Jiaxin Ge and Zora Zhiruo Wang and Chenyang Wang and Xiuyu Li and Michael J. Black and Trevor Darrell and Angjoo Kanazawa and Haiwen Feng}, year = {2026}, eprint = {2601.11109}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2601.11109}, }