paper-with-me

Papers

LAV: Audio-Driven Dynamic Visual Generation with Neural Compression and StyleGAN2

2025-05-15 · Jongmin Jung, Dasaem Jeong

This paper introduces LAV (Latent Audio-Visual), a system that integrates EnCodec's neural audio compression with StyleGAN2's generative capabilities to produce visually dynamic outputs driven by pre-recorded audio. Unlike previous works that rely on explicit feature mappings, LAV uses EnCodec embeddings as latent representations, directly transformed into StyleGAN2's style latent space via randomly initialized linear mapping. This approach preserves semantic richness in the transformation, enabling nuanced and semantically coherent audio-visual translations. The framework demonstrates the potential of using pretrained audio compression models for artistic and computational applications.

📄 PDF Abstract BibTeX arXiv:2505.10101

Code (0)

등록된 구현이 없습니다.

Tasks

Audio Compression

Similar Papers 제목 키워드 기반

DASH: Dynamic Audio-Driven Semantic Chunking for Efficient Omnimodal Token Compression

2026-03-15 · Bingzhou Li, Tao Huang arxiv

Omnimodal large language models (OmniLLMs) jointly process audio and visual streams, but the resulting long multimodal token sequences make inference prohibitively expensive. Existing compression methods typically rely o…

Audio-Visual Driven Compression for Low-Bitrate Talking Head Videos

2025-06-16 · Riku Takahashi, Ryugo Morita, Jinjia Zhou

Talking head video compression has advanced with neural rendering and keypoint-based methods, but challenges remain, especially at low bit rates, including handling large head movements, suboptimal lip synchronization, a…

Neural RenderingVideo Compression

Dual Audio-Centric Modality Coupling for Talking Head Generation

2025-03-26 · Ao Fu, Ziqi Ni, Yi Zhou

The generation of audio-driven talking head videos is a key challenge in computer vision and graphics, with applications in virtual avatars and digital media. Traditional approaches often struggle with capturing the comp…

NeRFTalking Head Generationtext-to-speechText to Speech

Audio-Visual Target Speaker Enhancement on Multi-Talker Environment using Event-Driven Cameras

2019-12-05 · Ander Arriandiaga, Giovanni Morrone, Luca Pasa, Leonardo Badino 외

We propose a method to address audio-visual target speaker enhancement in multi-talker environments using event-driven cameras. State of the art audio-visual speech separation methods shows that crucial information is th…

Optical Flow EstimationSpeech Separation

Do Joint Audio-Video Generation Models Understand Physics?

2026-05-08 · Zijun Cui, Xiulong Liu, Hao Fang, Mingwei Xu 외 arxiv

Joint audio-video generation models are rapidly approaching professional production quality, raising a central question: do they understand audio-visual physics, or merely generate plausible sounds and frames that violat…

Video Generation