@article{whennumbersspeakaligningtextualnumeralsa, title = {When Numbers Speak: Aligning Textual Numerals and Visual Instances in Text-to-Video Diffusion Models}, author = {Zhengyang Sun and Yu Chen and Xin Zhou and Xiaofan Li and Xiwu Chen and Dingkang Liang and Xiang Bai}, year = {2026}, eprint = {2604.08546}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2604.08546}, }