Skip to main content
QUICK REVIEW

[논문 리뷰] Temporally Consistent Transformers for Video Generation

Wilson Yan, Danijar Hafner|arXiv (Cornell University)|2022. 10. 05.
Generative Adversarial Networks and Image Synthesis인용 수 4
한 줄 요약

이 논문은 3D 환경에서 유도된 도전적인 장기 범위 비디오 벤치마크에서 장기 시계열 일관성을 달성하기 위해 비디오 프레임을 이산 잠복 변수로 압축하고, 이를 압축된 시퀀스에 가벼운 시계열 트랜스포머를 적용한 다음 공간적 MaskGit을 통해 고해상도 비디오를 재구성함으로써 장기 시계열 일관성을 확보하는 TECO라는 일관된 시계열 트랜스포머를 소개한다. TECO는 장기 시계열 일관성과 추론 속도 면에서 이전 모델들을 능가한다.

ABSTRACT

To generate accurate videos, algorithms have to understand the spatial and temporal dependencies in the world. Current algorithms enable accurate predictions over short horizons but tend to suffer from temporal inconsistencies. When generated content goes out of view and is later revisited, the model invents different content instead. Despite this severe limitation, no established benchmarks on complex data exist for rigorously evaluating video generation with long temporal dependencies. In this paper, we curate 3 challenging video datasets with long-range dependencies by rendering walks through 3D scenes of procedural mazes, Minecraft worlds, and indoor scans. We perform a comprehensive evaluation of current models and observe their limitations in temporal consistency. Moreover, we introduce the Temporally Consistent Transformer (TECO), a generative model that substantially improves long-term consistency while also reducing sampling time. By compressing its input sequence into fewer embeddings, applying a temporal transformer, and expanding back using a spatial MaskGit, TECO outperforms existing models across many metrics. Videos are available on the website: https://wilson1yan.github.io/teco

연구 동기 및 목표

  • 장기 시계열 일관성 평가를 위한 엄밀한 벤치마크 부족 문제를 해결한다.
  • 기존 비디오 생성 모델이 이전에 관찰한 장면 영역을 재방문할 때 일관성을 유지하지 못하는 실패 모드를 특정하고 정량화한다.
  • 장기 비디오 시퀀스에 스케일링되면서도 시계열 일관성을 유지하는 새로운 효율적인 아키텍처를 제안한다.
  • 계층적 압축과 재구성으로 인해 공간적 및 시계적 모델링을 분리함으로써 빠른 추론과 고해상도 생성을 가능하게 한다.

제안 방법

  • 3D 프로시저럴 장면을 렌더링하여 카메라 워크를 생성함으로써 DMLab, Minecraft, Habitat의 세 가지 새로운 비디오 데이터셋을 구축한다. 이는 장거리 시계열 의존성을 유도한다.
  • 입력 비디오 프레임을 이산 잠복 코드로 압축하기 위해 VQ-GAN 기반 인코더를 사용하여 시퀀스 길이와 계산 비용을 감소시킨다.
  • 압축된 잠복 시퀀스에 가벼운 시계열 트랜스포머를 적용하여 장거리 의존성을 효율적으로 모델링하고, 이로 인해 이차적 어텐션 복잡도를 피한다.
  • 각 프레임 별로 독립적으로 적용되는 공간적 MaskGit을 사용하여 고해상도 비디오 프레임을 재구성함으로써 공간적 세부 정보의 순차적 개선을 가능하게 한다.
  • 두 단계의 생성 프로세스를 설계한다: 먼저 시계열 트랜스포머를 통해 압축된 잠복 변수를 예측하고, 그 다음 MaskGit을 통해 픽셀 수준의 이미지를 재구성한다.
  • 모든 모델과 데이터셋에 동일한 총 학습 스텝 수를 유지하면서 코사인 학습률 스케줄, Adam 옵timizer를 사용해 학습을 최적화한다.

실험 결과

연구 질문

  • RQ1장기 비디오 시퀀스에서 이전에 관찰한 위치를 재방문할 때 최신 기술 비디오 생성 모델들이 시계열 일관성을 유지하는 데 얼마나 잘 성능을 내는가?
  • RQ2압축된 잠복 표현에 적용했을 때 트랜스포머 기반 모델이 비디오 생성에서 장거리 의존성을 효과적으로 모델링할 수 있는가?
  • RQ3종단 간 순차적 모델 대비 계층적 압축 및 재구성 기법이 추론 속도와 시계열 일관성 향상에 얼마나 기여하는가?
  • RQ4다운샘플링 인자, 모델 깊이 등의 다양한 아키텍처 선택 사항이 장기 시계열 비디오 생성 작업의 성능과 효율성에 미치는 영향은 어떠한가?
  • RQ5통합 프레임워크가 수백 프레임에 걸쳐 일관성을 유지하면서도 고해상도 생성과 빠른 추론을 동시에 달성할 수 있는가?

주요 결과

  • TECO는 DMLab와 Minecraft에서 264 프레임에 이르는 장기 시계열 예측에서 최신 기술 성능을 기록하며, LPIPS 값이 0.15~0.25로 낮은 수준의 시계열 일관성을 확보한다.
  • TECO는 이전 모델 대비 추론 시간을 수개의 주기로 감소시켜 고감도의 시각적 품질을 유지하면서도 매우 빠른 추론을 가능하게 한다.
  • 기존 모델들이 일관성 없거나 새로운 콘텐츠를 생성하는 것과는 달리, TECO는 이전에 관찰한 영역을 재방문할 때도 일관된 장면 콘텐츠를 유지한다.
  • DMLab 및 Minecraft 데이터셋에서 TECO는 FitVid 및 CW-VAE와 같은 강력한 베이스라인 모델보다 FVD 및 LPIPS 지표에서 뛰어난 성능을 보이며, FVD 개선 폭이 최대 15%에 이른다.
  • 프레임 별로 세부 정보를 개선하기 위해 공간적 MaskGit을 사용함으로써 표준 순차적 헤드 대비 특히 고해상도 환경에서 시각적 품질 향상이著격하게 향상된다.
  • 모델 깊이와 너비를 늘려 시계열 트랜스포머를 확장하면 장기간의 시퀀스에서 성능 향상이 이루어지며, 12층 모델이 품질과 효율성 간 최적의 균형을 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.