@article{chainofmodalitylearningmanipulation, title = {Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models}, author = {Chen Wang and Fei Xia and Wenhao Yu and Tingnan Zhang and Ruohan Zhang and C. Karen Liu and Li Fei-Fei and Jie Tan and Jacky Liang}, year = {2025}, eprint = {2504.13351}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2504.13351v1}, }