@article{howdoinstructionsshapespeechcrossattenti, title = {How Do Instructions Shape Speech? Cross-Attention Attribution for Style-Captioned Text-to-Speech}, author = {Nityanand Mathur and Hamees Sayed and Wasim Madha and Apoorv Singh and Sameer Khurana and Akshat Mandloi and Sudarshan Kamath}, year = {2026}, eprint = {2606.20532}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2606.20532}, }