@article{depthcachedepthguidedtrainingfreevisualt, title = {DepthCache: Depth-Guided Training-Free Visual Token Merging for Vision-Language-Action Model Inference}, author = {Yuquan Li and Lianjie Ma and Han Ding and Lijun Zhu}, year = {2026}, eprint = {2603.10469}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2603.10469}, }