Skip to main content
QUICK REVIEW

[논문 리뷰] StyleGAN-V: A Continuous Video Generator with the Price, Image Quality and Perks of StyleGAN2

Ivan Skorokhodov, Sergey Tulyakov|arXiv (Cornell University)|2021. 12. 29.
Advanced Vision and Imaging인용 수 8
한 줄 요약

StyleGAN-V는 운동 인식 위치 임베딩과 간소화된 효율적인 판별자로 영상을 시간 연속 신호로 간주하는 연속 시간 영상 생성 프레임워크를 제안한다. StyleGAN2 기반으로 구축되어 약 5% 높은 학습 비용만으로도 StyleGAN2 수준의 이미지 품질을 달성하며, 임의의 길이와 고프레임레트 영상 생성이 가능하고, 1024² 해상도를 포함한 5개의 벤치마크에서 평균적으로 이전 방법보다 30% 더 뛰어난 성능을 보였다.

ABSTRACT

Videos show continuous events, yet most $-$ if not all $-$ video synthesis frameworks treat them discretely in time. In this work, we think of videos of what they should be $-$ time-continuous signals, and extend the paradigm of neural representations to build a continuous-time video generator. For this, we first design continuous motion representations through the lens of positional embeddings. Then, we explore the question of training on very sparse videos and demonstrate that a good generator can be learned by using as few as 2 frames per clip. After that, we rethink the traditional image + video discriminators pair and design a holistic discriminator that aggregates temporal information by simply concatenating frames' features. This decreases the training cost and provides richer learning signal to the generator, making it possible to train directly on 1024$^2$ videos for the first time. We build our model on top of StyleGAN2 and it is just ${\approx}5\%$ more expensive to train at the same resolution while achieving almost the same image quality. Moreover, our latent space features similar properties, enabling spatial manipulations that our method can propagate in time. We can generate arbitrarily long videos at arbitrary high frame rate, while prior work struggles to generate even 64 frames at a fixed rate. Our model is tested on four modern 256$^2$ and one 1024$^2$-resolution video synthesis benchmarks. In terms of sheer metrics, it performs on average ${\approx}30\%$ better than the closest runner-up. Project website: https://universome.github.io.

연구 동기 및 목표

  • 이산 영상 생성의 한계를 해결하기 위해 영상을 이산적 프레임 시퀀스가 아니라 연속 시간 신호로 모델링하기 위해.
  • 최소한의 학습 데이터(클립당 최소 2 프레임 포함)로 고품질의 장기 영상 생성을 가능하게 하기 위해.
  • 3D 컨볼루션 대신 단순한 특징 연결을 사용하는 방식으로 판별자를 재설계하여 학습 비용을 줄이고 효율성을 향상시키기 위해.
  • 영상 생성에서 StyleGAN2의 의미적 제어 가능성과 잠재 공간 성질을 유지하기 위해.
  • 안정적이고 확장 가능한 고해상도 데이터셋에서 고프레임레트 비자율적 영상 합성과 함께 안정적인 확장 가능한 학습을 가능하게 하기 위해.

제안 방법

  • 운동 코드에 따라 변하는 시간에 따라 변하는 파라미터를 위치 임베딩에 도입하여 비주기적이고 영상 고유의 시간 표현을 가능하게 한다.
  • 비자율적 프레임 생성을 위해 불안정한 RNN(예: LSTM) 대신 팯팅 없는 1차원 컨볼루션 네트워크를 사용하여 운동 코드를 생성한다.
  • 프레임 특징을 결합하고 시간 간격을 조건으로 삼는 통합 판별자를 사용하여 별도의 이미지 및 영상 판별자가 필요 없도록 한다.
  • 데이터 및 계산 요구량을 줄이기 위해 클립당 2~4 프레임만 샘플링하고, 균일한 무작위 샘플링을 사용한다.
  • StyleGAN2 위에 생성자를 구축하여 잠재 공간의 구조를 유지하고, 시간에 걸쳐 일관되게 전파되는 의미적 편집을 가능하게 한다.
  • 최초로 1024² 해상도 영상 데이터셋을 직접 학습하여, StyleGAN2보다 약 5% 높은 비용만으로도 안정적인 학습을 달성한다.
StyleGAN-V: A Continuous Video Generator with the Price, Image Quality and Perks of StyleGAN2

실험 결과

연구 질문

  • RQ1영상 생성을 이산적 프레임 시퀀스가 아니라 연속 시간 신호로 효과적으로 모델링할 수 있는가?
  • RQ2클립당 2~4 프레임만으로도 고품질 영상 생성기를 학습할 수 있는가?
  • RQ3간소화된 2D 기반 판별자가 기존 3D 컨볼루션 판별자보다 성능을 뛰어나게 하면서도 학습 비용을 줄일 수 있는가?
  • RQ4운동 정보와 위치 정보를 시간 임베딩에서 분리하여 반복 및 '머리가 떨어지는' 등의 아티팩트를 방지할 수 있는가?
  • RQ5StyleGAN2의 잠재 공간은 얼마나 깊이 활용되어 의미적 제어가 가능하고 장기적인 영상 생성이 가능한가?

주요 결과

  • StyleGAN-V는 256² 및 1024² 해상도를 포함한 5개의 현대적 영상 생성 벤치마크에서 가장 가까운 경쟁자보다 평균적으로 약 30% 더 높은 성능을 달성했다.
  • StyleGAN2보다 약 5% 높은 비용만으로도 1024² 해상도 영상 데이터셋을 직접 학습하여, 이전까지는 달성되지 않았던 고해상도에서의 고품질 생성이 가능했다.
  • 임의의 길이와 프레임 레이트로 영상을 생성할 수 있어, MoCoGAN-HD 및 DIGAN과 같은 이전 모델의 불안정성과 길이 제한 문제를 극복했다.
  • 프레임 특징을 결합하고 시간 간격을 조건으로 삼는 통합 판별자는 학습 비용을 줄였고, 별도의 이미지 및 영상 판별자보다 더 rich한 기울기 신호를 제공한다.
  • StyleGAN2의 잠재 공간 성질을 유지하여, CLIP 등을 통한 의미적 편집이 시간에 걸쳐 일관되게 전파되는 것을 가능하게 했다.
  • 클립당 최소 2 프레임만으로도 의미 있는 생성기를 학습할 수 있으며, 이는 이론적 및 실증적으로 검증되었다.
StyleGAN-V: A Continuous Video Generator with the Price, Image Quality and Perks of StyleGAN2

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.