paper-with-me

Papers

OpenDance: Multimodal Controllable 3D Dance Generation Using Large-scale Internet Data

2025-06-09 · Jinlu Zhang, Zixi Kang, Yizhou Wang

Music-driven dance generation offers significant creative potential yet faces considerable challenges. The absence of fine-grained multimodal data and the difficulty of flexible multi-conditional generation limit previous works on generation controllability and diversity in practice. In this paper, we build OpenDance5D, an extensive human dance dataset comprising over 101 hours across 14 distinct genres. Each sample has five modalities to facilitate robust cross-modal learning: RGB video, audio, 2D keypoints, 3D motion, and fine-grained textual descriptions from human arts. Furthermore, we propose OpenDanceNet, a unified masked modeling framework for controllable dance generation conditioned on music and arbitrary combinations of text prompts, keypoints, or character positioning. Comprehensive experiments demonstrate that OpenDanceNet achieves high-fidelity and flexible controllability.

📄 PDF Abstract BibTeX arXiv:2506.07565

Code (0)

등록된 구현이 없습니다.

Tasks

Diversity

Similar Papers 제목 키워드 기반

Stance-Driven Multimodal Controlled Statement Generation: New Dataset and Task

2025-04-04 · Bingqian Wang, Quan Fang, Jiachen Sun, Xiaoxiao Ma

Formulating statements that support diverse or controversial stances on specific topics is vital for platforms that enable user expression, reshape political discourse, and drive social critique and information dissemina…

Marketingmultimodal generationStance DetectionText Generation

ConsistCompose: Unified Multimodal Layout Control for Image Composition

2025-11-23 · Xuanke Shi, Boxuan Li, Xiaoyang Han, Zhongang Cai 외 arxiv

Unified multimodal models that couple visual understanding with image generation have advanced rapidly, yet most systems still focus on visual grounding-aligning language with image regions-while their generative counter…

Visual GroundingImage Generation

Any2Caption:Interpreting Any Condition to Caption for Controllable Video Generation

2025-03-31 · Shengqiong Wu, Weicai Ye, Jiahao Wang, Quande Liu 외

To address the bottleneck of accurate user intent interpretation within the current video generation community, we present Any2Caption, a novel framework for controllable video generation under any condition. The key ide…

Video Generation

FlexEControl: Flexible and Efficient Multimodal Control for Text-to-Image Generation

2024-05-08 · Xuehai He, Jian Zheng, Jacob Zhiyuan Fang, Robinson Piramuthu 외

Controllable text-to-image (T2I) diffusion models generate images conditioned on both text prompts and semantic inputs of other modalities like edge maps. Nevertheless, current controllable T2I methods commonly face chal…

Image GenerationText to Image GenerationText-to-Image Generation

MM-Sonate: Multimodal Controllable Audio-Video Generation with Zero-Shot Voice Cloning

2026-01-04 · Chunyu Qiang, Jun Wang, Xiaopeng Wang, Kang Yin 외 arxiv

Joint audio-video generation aims to synthesize synchronized multisensory content, yet current unified models struggle with fine-grained acoustic control, particularly for identity-preserving speech. Existing approaches …

Video Generation