paper-with-me

Audio Generation

3개 벤치마크 · 논문 392편 · 이 태스크의 논문 보기 →

Benchmarks

AudioCaps

결과 23개

Symphony music

결과 1개

Most implemented

WaveNet: A Generative Model for Raw Audio

2016-09-12 · 구현 62개

Adversarial Audio Synthesis

2018-02-12 · 구현 22개

Papers

StepAudio 3 Gen Technical Report

2026-09-11 · Bin Lin, Bo Zhao, Boyang Wang, Boyang Zhang 외 hf

We introduce StepAudio 3 Gen, a general-purpose audio generation model that supports zero-shot text-to-speech (TTS), voice design, vocal generation, sound effects, music, vibe speech, and mixtures of multiple audio types…

Audio Generation

PRISM-Bench: An Audio-Centric Diagnostic Benchmark for Text-to-Audio-Video Generation

2026-09-04 · Yuchen Sun, Qian Yang, Jun Wang, Detai Xin 외 arxiv

Text-to-audio-video (T2AV) generation has advanced rapidly, but its evaluation still underestimates the audio modality. Existing benchmarks either treat audio as an auxiliary component of video quality or assess it in is…

Audio GenerationVideo Generation

The Attention Triangle in Audio-Video Models

2026-09-03 · Sagi Polaczek, Noa Kraicer, Gal Metzer, Zhuo Ning 외 hf

Audio-video diffusion models rely on cross-modal attention to coordinate text, sound, and visual content, yet this same mechanism can introduce subtle and systematic semantic leakage. We study these models by probing and…

Audio GenerationVideo Generation

The Missing Temporal Link: Temporal Context Routing for Script-Driven Audio-Video Generation

2026-09-02 · Yichen Liu, Quanwei Zhang, Haozhe Wang, Donghao Zhou 외 hf

Joint audio-video generation models have made substantial progress in visual quality and audio-visual synchronization. However, they still provide limited control over when shot transitions occur and dialogue is spoken. …

Audio GenerationVideo Generation

TurboT2VA: Fast Large-Scale Text-to-Video-Audio Generation via Score-Regularized Consistency Distillation

2026-08-25 · Xiaoda Yang, Yuxiang Liu, Kaiwen Zheng, Yuan Liu 외 arxiv

Joint text-to-video-audio generation produces synchronized visual and acoustic content, but the long sampling trajectories and heterogeneous multimodal computation of large models make inference prohibitively expensive. …

Audio Generation

Geometric Iterative Retrieval for Neural Audio Codec Resynthesis

2026-08-19 · Leo Schmidt-Traub, Frédéric Berdoz, Luca A. Lanzendörfer, Roger Wattenhofer arxiv

Neural audio codecs based on Residual Vector Quantization (RVQ) have become the dominant discrete representation for token-based general audio generation, yet resynthesizing high-quality audio from coarse codec tokens re…

Audio Generation

전체 392편 보기 →