@article{seeingsoundslearningaudiotovisualalignme, title = {SeeingSounds: Learning Audio-to-Visual Alignment via Text}, author = {Simone Carnemolla and Matteo Pennisi and Chiara Russo and Simone Palazzo and Daniela Giordano and Concetto Spampinato}, year = {2025}, eprint = {2510.11738}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2510.11738}, }