@article{pointactvisionlanguageactionmodelswithmu, title = {PointACT: Vision-Language-Action Models with Multi-Scale Point-Action Interaction}, author = {Shizhe Chen and Paul Pacaud and Cordelia Schmid}, year = {2026}, eprint = {2605.21414}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2605.21414}, }