paper-with-me

Papers

A Survey on Music Generation from Single-Modal, Cross-Modal, and Multi-Modal Perspectives

2025-04-01 · Shuyu Li, Shulei Ji, ZiHao Wang, Songruoyao Wu, Jiaxing Yu, Kejun Zhang

Multi-modal music generation, using multiple modalities like text, images, and video alongside musical scores and audio as guidance, is an emerging research area with broad applications. This paper reviews this field, categorizing music generation systems from the perspective of modalities. The review covers modality representation, multi-modal data alignment, and their utilization to guide music generation. Current datasets and evaluation methods are also discussed. Key challenges in this area include effective multi-modal integration, large-scale comprehensive datasets, and systematic evaluation methods. Finally, an outlook on future research directions is provided, focusing on creativity, efficiency, multi-modal alignment, and evaluation.

📄 PDF Abstract BibTeX arXiv:2504.00837

Code (0)

등록된 구현이 없습니다.

Tasks

Music Generation

Similar Papers 제목 키워드 기반

Vision-to-Music Generation: A Survey

2025-03-27 · Zhaokai Wang, Chenxi Bao, Le Zhuo, Jingrui Han 외

Vision-to-music Generation, including video-to-music and image-to-music tasks, is a significant branch of multimodal artificial intelligence demonstrating vast application prospects in fields such as film scoring, short …

multimodal generationMusic GenerationSurvey

UniMuMo: Unified Text, Music and Motion Generation

2024-10-06 · Han Yang, Kun Su, Yutong Zhang, Jiaben Chen 외

We introduce UniMuMo, a unified multimodal model capable of taking arbitrary text, music, and motion data as input conditions to generate outputs across all three modalities. To address the lack of time-synchronized data…

DecoderMotion Generation

A Comprehensive Survey on Generative AI for Video-to-Music Generation

2025-02-18 · Shulei Ji, Songruoyao Wu, ZiHao Wang, Shuyu Li 외

The burgeoning growth of video-to-music generation can be attributed to the ascendancy of multimodal generative models. However, there is a lack of literature that comprehensively combs through the work in this field. To…

Music Generation

Unified Cross-modal Translation of Score Images, Symbolic Music, and Performance Audio

2025-05-19 · Jongmin Jung, Dongmin Kim, SiHun Lee, Seola Cho 외

Music exists in various modalities, such as score images, symbolic scores, MIDI, and audio. Translations between each modality are established as core tasks of music information retrieval, such as automatic music transcr…

Audio GenerationInformation RetrievalMusic GenerationMusic Information Retrieval+2

TM2D: Bimodality Driven 3D Dance Generation via Music-Text Integration

2023-04-05 · ICCV 2023 1 · Kehong Gong, Dongze Lian, Heng Chang, Chuan Guo 외

We propose a novel task for generating 3D dance movements that simultaneously incorporate both text and music modalities. Unlike existing works that generate dance movements using a single modality such as music, our goa…

Motion Generationmotion predictionMotion Synthesis