paper-with-me

홈 › Papers

An Impartial Transformer for Story Visualization

2023-01-09 · Nikolaos Tsakas, Maria Lymperaiou, Giorgos Filandrianos, Giorgos Stamou

Story Visualization is an advanced task of computed vision that targets sequential image synthesis, where the generated samples need to be realistic, faithful to their conditioning and sequentially consistent. Our work proposes a novel architectural and training approach: the Impartial Transformer achieves both text-relevant plausible scenes and sequential consistency utilizing as few trainable parameters as possible. This enhancement is even able to handle synthesis of 'hard' samples with occluded objects, achieving improved evaluation metrics comparing to past approaches.

📄 PDF Abstract BibTeX arXiv:2301.03563

Code (0)

등록된 구현이 없습니다.

Tasks

Image GenerationStory Visualization

Methods 이 논문이 사용한 방법론

Multi-Head Attention 설명 없음
Attention 설명 없음
Position-Wise Feed-Forward Layer 설명 없음
Adam 설명 없음
BPE Byte Pair Encoding, or BPE, is a subword segmentation algorithm that encodes rare and unknown words as sequences of subword units. The intuition is that various word…
Linear Layer A Linear Layer is a projection $\mathbf{XW + b}$.
Dropout Dropout is a regularization technique for neural networks that drops a unit (along with connections) at training time with a specified probability $p$ (a common value is…
Softmax The Softmax output function transforms a previous layer's output into a vector of probabilities. It is commonly used for multiclass classification. Given an input vector $x$…

Similar Papers 제목 키워드 기반

Generating a Temporally Coherent Image Sequence for a Story by Multimodal Recurrent Transformers

2021-11-16 · ACL ARR November 2021 11 · Anonymous

Story visualization is a challenging text-to-image generation task for the difficulty of rendering visual details from abstract text descriptions. Besides the difficulty of image generation, the generator also need to c…

Image GenerationSentenceStory VisualizationText to Image Generation+1

StoryDALL-E: Adapting Pretrained Text-to-Image Transformers for Story Continuation

2022-09-13 · Adyasha Maharana, Darryl Hannan, Mohit Bansal

Recent advances in text-to-image synthesis have led to large pretrained transformers with excellent capabilities to generate visualizations from a given text. However, these models are ill-suited for specialized tasks li…

Image GenerationStory ContinuationStory VisualizationVideo Captioning

Character-Centric Story Visualization via Visual Planning and Token Alignment

2022-10-16 · Hong Chen, Rujun Han, Te-Lin Wu, Hideki Nakayama 외

Story visualization advances the traditional text-to-image generation by enabling multiple image generation based on a complete story. This task requires machines to 1) understand long text inputs and 2) produce a global…

Image GenerationStory VisualizationText to Image GenerationText-to-Image Generation

Generating a Temporally Coherent Visual Story by Multimodal Recurrent Transformers

2022-01-16 · ACL ARR January 2022 1 · Anonymous

Story visualization is a challenging text-to-image generation task for the difficulty of rendering visual details from abstract text descriptions. Besides the difficulty of image generation, the generator also needs to c…

Image GenerationSentenceStory VisualizationText to Image Generation+1

Character-Preserving Coherent Story Visualization

2020-08-01 · ECCV 2020 8 · Yun-Zhu Song, Zhi Rui Tam, Hung-Jen Chen, Huiao-Han Lu 외

Story visualization aims at generating a sequence of images to narrate each sentence in a multi-sentence story. Different from video generation that focuses on maintaining the continuity of generated images (frames), sto…

Representation LearningSentenceStory Visualization