Audio Generation
3개 벤치마크 · 논문 392편 · 이 태스크의 논문 보기 →
Benchmarks
Most implemented
WaveNet: A Generative Model for Raw Audio
Adversarial Audio Synthesis
AudioLM: a Language Modeling Approach to Audio Generation
It's Raw! Audio Generation with State-Space Models
GANSynth: Adversarial Neural Audio Synthesis
BigVGAN: A Universal Neural Vocoder with Large-Scale Training
Papers
StepAudio 3 Gen Technical Report
We introduce StepAudio 3 Gen, a general-purpose audio generation model that supports zero-shot text-to-speech (TTS), voice design, vocal generation, sound effects, music, vibe speech, and mixtures of multiple audio types…
Audio GenerationPRISM-Bench: An Audio-Centric Diagnostic Benchmark for Text-to-Audio-Video Generation
Text-to-audio-video (T2AV) generation has advanced rapidly, but its evaluation still underestimates the audio modality. Existing benchmarks either treat audio as an auxiliary component of video quality or assess it in is…
Audio GenerationVideo GenerationThe Attention Triangle in Audio-Video Models
Audio-video diffusion models rely on cross-modal attention to coordinate text, sound, and visual content, yet this same mechanism can introduce subtle and systematic semantic leakage. We study these models by probing and…
Audio GenerationVideo GenerationThe Missing Temporal Link: Temporal Context Routing for Script-Driven Audio-Video Generation
Joint audio-video generation models have made substantial progress in visual quality and audio-visual synchronization. However, they still provide limited control over when shot transitions occur and dialogue is spoken. …
Audio GenerationVideo GenerationTurboT2VA: Fast Large-Scale Text-to-Video-Audio Generation via Score-Regularized Consistency Distillation
Joint text-to-video-audio generation produces synchronized visual and acoustic content, but the long sampling trajectories and heterogeneous multimodal computation of large models make inference prohibitively expensive. …
Audio GenerationGeometric Iterative Retrieval for Neural Audio Codec Resynthesis
Neural audio codecs based on Residual Vector Quantization (RVQ) have become the dominant discrete representation for token-based general audio generation, yet resynthesizing high-quality audio from coarse codec tokens re…
Audio Generation