@article{scenealignaligningmultimodalreasoningtos, title = {SceneAlign: Aligning Multimodal Reasoning to Scene Graphs in Complex Visual Scenes}, author = {Chuhan Wang and Xintong Li and Jennifer Yuntong Zhang and Junda Wu and Chengkai Huang and Lina Yao and Julian McAuley and Jingbo Shang}, year = {2026}, eprint = {2601.05600}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2601.05600}, }