Skip to main content
QUICK REVIEW

[논문 리뷰] Seer: Language Instructed Video Prediction with Latent Diffusion Models

Xianfan Gu, Chuan Wen|arXiv (Cornell University)|2023. 03. 27.
Multimodal Machine Learning Applications인용 수 6
한 줄 요약

Seer는 초기 프레임과 자연어 지시어를 조건으로 하여 고해상도, 지시어에 부합하는 비디오 프레임을 생성하기 위해 미세조정된 텍스트-이미지 확산 모델을 시간 축으로 팽창시켜 비디오 예측 모델을 제안한다. 공간-시간 attention과 프레임 순차 텍스트 분해기(Frame Sequential Text Decomposer)를 도입함으로써 Seer는 오직 480 GPU 시간만으로 SSv2에서 FVD가 31% 낮고 인간 선호도가 83.7%에 이르는 최신 기술 수준(SOTA)의 성능을 달성한다. 이는 이전 방법들에 비해 상당히 낮은 계산 자원 소비를 의미한다.

ABSTRACT

Imagining the future trajectory is the key for robots to make sound planning and successfully reach their goals. Therefore, text-conditioned video prediction (TVP) is an essential task to facilitate general robot policy learning. To tackle this task and empower robots with the ability to foresee the future, we propose a sample and computation-efficient model, named extbf{Seer}, by inflating the pretrained text-to-image (T2I) stable diffusion models along the temporal axis. We enhance the U-Net and language conditioning model by incorporating computation-efficient spatial-temporal attention. Furthermore, we introduce a novel Frame Sequential Text Decomposer module that dissects a sentence's global instruction into temporally aligned sub-instructions, ensuring precise integration into each frame of generation. Our framework allows us to effectively leverage the extensive prior knowledge embedded in pretrained T2I models across the frames. With the adaptable-designed architecture, Seer makes it possible to generate high-fidelity, coherent, and instruction-aligned video frames by fine-tuning a few layers on a small amount of data. The experimental results on Something Something V2 (SSv2), Bridgedata and EpicKitchens-100 datasets demonstrate our superior video prediction performance with around 480-GPU hours versus CogVideo with over 12,480-GPU hours: achieving the 31% FVD improvement compared to the current SOTA model on SSv2 and 83.7% average preference in the human evaluation.

연구 동기 및 목표

  • 초기 프레임과 자연어 지시어를 조건으로 하여 시간적으로 일관성 있고 고해상도의 비디오 프레임을 생성하는 데 도전한다.
  • 사전 훈련된 텍스트-이미지 확산 모델을 활용하여 텍스트-비디오 생성에 일반적으로 요구되는 높은 계산 및 데이터 요구량을 줄인다.
  • 전체 지시어를 시간적으로 정렬된 하위 지시어로 분해하여 언어 지시어와 각 프레임의 운동 간의 정교한 일치도를 향상시킨다.
  • 사전 훈련된 모델을 적응시켜 전체에서 훈련하는 대신 소규모 데이터셋에서 효율적인 미세조정을 가능하게 한다.
  • 높은 시각적 정확도와 지시어 일관성을 유지하면서도 비디오 예측에서 뛰어난 성능을 달성한다.

제안 방법

  • 사전 훈련된 2D 텍스트-이미지 확산 모델을 3D U-Net 아키텍처로 팽창시켜 공간적 및 시간적 종속성을 동시에 모델링한다.
  • 잠재 공간 내에서 장거리 시간 동적 특성을 효율적으로 모델링하기 위해 스케일드 순차적 창 시간 attention(Scaled Autoregressive Window Temporal Attention)을 도입한다.
  • 전체 텍스트 지시어를 시간적으로 정렬된 하위 지시어로 분할하여 각 프레임에 조건을 주는 데 사용하는 프레임 순차 텍스트 분해기(Frame Sequential Text Decomposer)를 설계한다.
  • 소규모 텍스트-비디오 데이터셋에서 모델의 몇몇 레이어만을 미세조정하여 사전 훈련된 사전 지식를 유지하면서도 비디오 생성에 적합하게 조정한다.
  • 노이즈 예측 헤드를 갖춘 잠재 확산 모델을 사용하여 잠재 공간에서 단계적으로 비디오 프레임을 생성함으로써 고해상도 출력을 보장한다.
  • 화면 보간 및 반복 전략을 적용하여 추가적인 추론 비용 없이 원래의 12프레임 범위를 초월해 생성을 연장한다.

실험 결과

연구 질문

  • RQ1사전 훈련된 텍스트-이미지 확산 모델이 최소한의 미세조정으로 텍스트 조건 기반 비디오 예측에 효과적으로 적용될 수 있는가?
  • RQ2전체 언어 지시어는 어떻게 시간적으로 정렬된 하위 지시어로 분해되어 각 프레임의 운동 일치도를 향상시킬 수 있는가?
  • RQ33D U-Net 아키텍처 내의 공간-시간 attention이 생성된 비디오 프레임의 시간적 일관성과 시각적 품질을 어느 정도 유지할 수 있는가?
  • RQ4기존 방법들에 비해 상당히 낮은 계산 비용으로도 비디오 예측에서 최신 기술 수준의 성능을 달성할 수 있는가?
  • RQ5모델은 다양한 시나리오 복잡도와 운동 역학을 가진 다양한 데이터셋에 대해 얼마나 잘 일반화되는가?

주요 결과

  • Seer는 Something-Something V2 데이터셋에서 이전 SOTA 모델 대비 FVD(Fréchet Video Distance)가 31% 향상되어 FVD 14.2를 기록했으며, 이는 이전의 20.5에 비해 향상된 성능이다.
  • 인간 평가에서 Seer는 다른 최신 기술 수준의 모델들과 비교해 83.7%의 경우에서 선호되었으며, 이는 강력한 시각적 품질과 지시어 일치도를 의미한다.
  • 훈련에 필요한 GPU 시간은 오직 480시간으로, CogVideo의 12,480시간 대비 96% 감소하여 놀라운 데이터 및 계산 효율성을 입증한다.
  • 프레임 순차 텍스트 분해기는 '맥주 캔 기울이기' 또는 '카드 떨어뜨리기'와 같은 작업 수준의 지시어에 부합하는 정밀한 운동 생성을 가능하게 한다.
  • Seer는 SSv2, BridgeData, Epic-Kitchens-100 등 다양한 데이터셋에서 잘 일반화되며, 다양한 운동 유형과 환경에 대해 뛰어난 견고성을 보인다.
  • 강력한 성능에도 불구하고 Seer는 종종 외관 일관성(예: 물체의 색상 또는 배경)을 유지하지 못하거나 참조 프레임에 존재하지 않는 새로운 카메라 자세나 시야를 생성할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.