Skip to main content
QUICK REVIEW

[논문 리뷰] NÜWA: Visual Synthesis Pre-training for Neural visUal World creAtion

Chenfei Wu, Jian Liang|arXiv (Cornell University)|2021. 11. 24.
Multimodal Machine Learning Applications인용 수 7
한 줄 요약

NÜWA는 3D 근접 주의(3DNA)를 사용하는 공유 인코더-디코더 아키텍처를 갖춘 3D 트랜스포머 기반의 통합 사전 훈련 모델로, 이미지 및 영상 생성 및 편집을 가능하게 하며, 텍스트-이미지 및 텍스트-영상 생성을 포함한 8개의 시각 합성 과제에서 최신 기술 수준의 성능을 달성한다. 이는 편집 과제에서 강력한 제로샷 능력을 보인다.

ABSTRACT

This paper presents a unified multimodal pre-trained model called NÜWA that can generate new or manipulate existing visual data (i.e., images and videos) for various visual synthesis tasks. To cover language, image, and video at the same time for different scenarios, a 3D transformer encoder-decoder framework is designed, which can not only deal with videos as 3D data but also adapt to texts and images as 1D and 2D data, respectively. A 3D Nearby Attention (3DNA) mechanism is also proposed to consider the nature of the visual data and reduce the computational complexity. We evaluate NÜWA on 8 downstream tasks. Compared to several strong baselines, NÜWA achieves state-of-the-art results on text-to-image generation, text-to-video generation, video prediction, etc. Furthermore, it also shows surprisingly good zero-shot capabilities on text-guided image and video manipulation tasks. Project repo is https://github.com/microsoft/NUWA.

연구 동기 및 목표

  • 텍스트, 이미지, 영상 등 다양한 모odal을 하나의 프레임워크 내에서 처리할 수 있는 통합 다중모달 사전 훈련 모델을 개발하는 것.
  • 기존의 순차적 시각 모델의 계산 비효율성과 일반화 능력의 한계를 해결하기 위해 공간적·시간적 국소성을 고려하는 3D 주의 메커니즘을 도입하는 것.
  • 공유된 다중모달 사전 훈련 디코더를 활용해 텍스트 기반 이미지 및 영상 편집을 제로샷으로 가능하게 하는 것.
  • VQ-GAN 기반 이산 토큰화와 이미지 및 영상 데이터에 대한 다중 과제 사전 훈련을 조합함으로써 시각 생성 품질과 확장성을 향상시키는 것.
  • 이미지와 영상 모델링을 동일한 아키텍처로 통합하여 양 모달에 대해 공동 사전 훈련을 통해 의미적·구조적 일致성을 향상시키는 것.

제안 방법

  • 텍스트를 1D, 이미지를 2D, 영상을 3D 시퀀스로 간주하는 3D 트랜스포머 인코더-디코더 프레임워크를 설계하여 다양한 모달 간의 통합 처리를 가능하게 한다.
  • 근접한 공간적·시간적 토큰에만 자기주의를 제한하는 스파스 주의 메커니즘인 3D 근접 주의(3DNA)를 도입하여 계산량을 줄이면서도 국소적 구조를 유지한다.
  • 생성 품질 향상과 고해상도 데이터에 대한 효율적 사전 훈련을 위해 VQ-VAE 대신 VQ-GAN을 사용하여 이산 시각 토큰화를 수행한다.
  • 텍스트-이미지(T2I), 텍스트-영상(T2V), 영상-영상(V2V)의 세 핵심 과제에 대해 다중 과제 사전 훈련을 구현하여 다중모달 및 영상 전용 표현을 공동으로 학습한다.
  • 부분 입력이나 텍스트 프롬프트에 조건을 주어 동일한 디코더를 사용해 8개의 후행 과제(이미지/영상 생성, 완성, 예측, 텍스트 기반 편집 포함)를 처리한다.
  • 텍스트 또는 시각 스케치(예: 3D 스케치)를 처리하는 공유 적응형 인코더를 적용하고, 이를 공유 디코더에 피드백하여 생성 또는 편집을 수행한다.

실험 결과

연구 질문

  • RQ1통합 3D 트랜스포머 아키텍처는 텍스트, 이미지, 영상 간 다양한 시각 합성 과제를 효과적으로 처리할 수 있는가?
  • RQ23D 근접 주의 메커니즘이 축 방향 또는 전체 자기주의와 비교해 영상 및 이미지 생성에서 생성 품질과 계산 효율성을 향상시키는가?
  • RQ3T2I, T2V, V2V에 대한 다중 과제 사전 훈련이 텍스트 기반 이미지 및 영상 편집의 제로샷 성능 향상에 얼마나 기여하는가?
  • RQ4사전 훈련 단계에서 이미지 및 영상 데이터를 통합적으로 처리할 경우, 단일 모달로만 훈련된 모델과 비교해 후행 시각 합성 성능에 어떤 영향을 미치는가?
  • RQ5단일 사전 훈련 모델이 텍스트 프롬프트와 부분 입력만으로 피팅 없이 제로샷 편집 과제에 일반화 가능한가?

주요 결과

  • NÜWA는 MSR-VTT 데이터셋에서 텍스트-영상 생성 과제에서 FID-vid 47.68을 달성하여 기존 베이스라인 대비 뚜렷한 성능 우월성을 보였다.
  • MSR-VTT에서 CLIPSIM 점수 0.2439를 기록하여 생성된 영상와 텍스트 기술 간의 강한 의미적 일치를 확인했다.
  • T2I, T2V, V2V에 대한 다중 과제 사전 훈련을 통해 T2V만으로 훈련한 경우 대비 FID-vid가 5.3점 향상되어 공동 학습의 유용성을 입증했다.
  • 3DNA 메커니즘은 계산 복잡도를 감소시키면서도 시각 품질 향상을 보였으며, VSPW 스케치-영상 과제에서 FID-vid 27.79 및 검출된 PA 0.6085로 이를 입증했다.
  • NÜWA는 텍스트 기반 영상 편집 과제에서 강력한 제로샷 능력을 보였으며, 단일 프롬프트로 수영하는 물고기가 표면, 바닥, 또는 상공으로 올라가는 것을 성공적으로 생성했다.
  • 전체 자기주의로 인코더 또는 디코더를 교체할 경우 성능 저하가 발생함으로써 국소화된 주의가 고품질 생성에 필수적임을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.