Papers Multimodal Music Generation
“Multimodal Music Generation” 태그가 달린 논문 3편 · 필터 해제
Multimodal Music Generation with Explicit Bridges and Retrieval Augmentation
2024-12-12
· Baisen Wang, Le Zhuo, Zhaokai Wang, Chenxi Bao 외
Multimodal music generation aims to produce music from diverse input modalities, including text, videos, and images. Existing methods use a common embedding space for multimodal fusion. Despite their effectiveness in oth…
cross-modal alignmentMultimodal Music GenerationMusic GenerationRetrievalMozart's Touch: A Lightweight Multi-modal Music Generation Framework Based on Pre-Trained Large Models
2024-05-05
· Jiajun Li, Tianze Xu, Xuesong Chen, Xinrui Yao 외
In recent years, AI-Generated Content (AIGC) has witnessed rapid advancements, facilitating the creation of music, images, and other artistic forms across a wide range of industries. However, current models for image- an…
DescriptiveLanguage ModelingLanguage ModellingLarge Language Model+2Music Understanding LLaMA: Advancing Text-to-Music Generation with Question Answering and Captioning
2023-08-22
· Shansong Liu, Atin Sakkeer Hussain, Chenshuo Sun, Ying Shan
Text-to-music generation (T2M-Gen) faces a major obstacle due to the scarcity of large-scale publicly available music datasets with natural language captions. To address this, we propose the Music Understanding LLaMA (MU…
Caption GenerationLarge Language ModelMultimodal Music GenerationMusic Captioning+2
1–3 / 3