@article{whenllavameetsobjectstokencompositionfor, title = {When LLaVA Meets Objects: Token Composition for Vision-Language-Models}, author = {Soumya Jahagirdar and Walid Bousselham and Anna Kukleva and Hilde Kuehne}, year = {2026}, eprint = {2602.04864}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2602.04864}, }