Skip to main content
QUICK REVIEW

[논문 리뷰] WorldGPT: A Sora-Inspired Video AI Agent as Rich World Models from Text and Image Inputs

Deshun Yang, Luhui Hu|arXiv (Cornell University)|2024. 03. 10.
Multimodal Machine Learning Applications인용 수 4
한 줄 요약

WorldGPT는 Sora를 영감으로 삼은 비디오 AI 에이전트로, 두 단계의 파이프라인을 통해 텍스트 및 이미지 입력에서 고품질이고 시간적으로 일관된 비디오를 생성한다. 첫 번째 단계는 GPT 기반 프롬프트 향상 모듈로 정밀한 지시어 보완을 수행하고, 두 번째 단계는 关键 프레임을 활용해 운동의 부드러움을 향상시키는 확산 기반 비디오 생성 모듈을 포함한다. 이 방법은 텍스트-비디오 정렬, 시간적 일관성, 운동 품질에서 최신 기술 수준을 달성했으며, 인간 평가에서 DynamiCrafter와 I2VGen-XL을 모두 능가한다.

ABSTRACT

Several text-to-video diffusion models have demonstrated commendable capabilities in synthesizing high-quality video content. However, it remains a formidable challenge pertaining to maintaining temporal consistency and ensuring action smoothness throughout the generated sequences. In this paper, we present an innovative video generation AI agent that harnesses the power of Sora-inspired multimodal learning to build skilled world models framework based on textual prompts and accompanying images. The framework includes two parts: prompt enhancer and full video translation. The first part employs the capabilities of ChatGPT to meticulously distill and proactively construct precise prompts for each subsequent step, thereby guaranteeing the utmost accuracy in prompt communication and accurate execution in following model operations. The second part employ compatible with existing advanced diffusion techniques to expansively generate and refine the key frame at the conclusion of a video. Then we can expertly harness the power of leading and trailing key frames to craft videos with enhanced temporal consistency and action smoothness. The experimental results confirm that our method has strong effectiveness and novelty in constructing world models from text and image inputs over the other methods.

연구 동기 및 목표

  • 텍스트에서 비디오로의 생성 과정에서 시간적 일관성과 동작의 부드러움을 유지하는 데 도전하는 것.
  • 다중모달 입력(텍스트 및 이미지)을 통합된 월드 모델 프레임워크에 통합하여 비디오 생성 품질을 향상시키는 것.
  • 비디오 생성을 이끄는 정밀한 GPT 최적화 프롬프트를 통해 사용자 제어력을 향상시키는 것.
  • 기존 고성능 확산 모델을 활용해 고해상도 비디오 합성과 향상된 시공간 일관성을 갖춘 파이프라인을 개발하는 것.
  • 제로샷 벤치마크와 인간 선호도 연구를 통해 성능을 평가하고, 정렬 및 운동 품질 측면에서 열등함을 입증하는 것.

제안 방법

  • 프레임워크는 두 단계로 구성된 파이프라인을 사용한다: 비디오 생성을 위한 정밀한 텍스트 지시어를 보완하고 사전에 구성하는 데 GPT를 활용한 프롬프트 향상 모듈.
  • 전체 비디오 번역 단계에서는 시작 및 종료 시퀀스의 关键 프레임을 생성하고 개선하기 위해 호환 가능한 확산 기법을 사용한다.
  • 시간적 일관성을 향상시키기 위해 앞서 오는 및 뒤이어 오는 关键 프레임을 활용해 중간 프레임 생성을 이끈다.
  • 동적 시점 모델링과 다중모달 융합을 통합하여 비디오 콘텐츠를 텍스트 기술 및 입력 이미지와 정렬한다.
  • 시공간 일관성을 확보하기 위해 광학 흐름(F)과 외형 변화 필드(B)를 사용해 생성된 프레임과 진실값 간의 차이를 최소화하는 손실 함수를 적용한다.
  • AIGCBench 벤치마크와 인간 선호도 연구를 통해 DynamiCrafter 및 I2VGen-XL과 비교하여 평가한다.

실험 결과

연구 질문

  • RQ1GPT 기반 프롬프트 생성 전략이 비디오 생성에서 텍스트-비디오 정렬을 상당히 향상시킬 수 있는가?
  • RQ2기반 프레임 기반의 확산 모델링이 생성된 비디오의 시간적 일관성과 운동의 부드러움을 얼마나 효과적으로 향상시킬 수 있는가?
  • RQ3텍스트 및 이미지 입력의 다중모달 융합이 비디오 생성의 제어력과 다양성에 얼마나 기여하는가?
  • RQ4제로샷 비디오 생성 벤치마크에서 제안된 방법이 DynamiCrafter 및 I2VGen-XL과 같은 최신 기술 모델과 비교해 어떻게 성능을 냈는가?
  • RQ5사용자 평가에서 비디오 품질, 운동의 현실감, 정렬에 대해 인간의 선호는 어떠한가?

주요 결과

  • WorldGPT는 AIGCBench에서 GenVideo-Text Clip 점수 0.307을 기록하여, DynamiCrafter(0.24)와 I2VGen-XL(0.26)을 모두 능가하는 텍스트-비디오 정렬 성능을 달성했다.
  • GenVideo Clip 메트릭 기준으로 시간적 일관성 점수는 0.992를 기록했으며, DynamiCrafter(0.980)와 I2VGen-XL(0.960)을 모두 초월했다.
  • 인간 평가에서 66.8%의 참가자가 WorldGPT의 운동 품질을 DynamiCrafter보다 선호했고, 68.7%는 I2VGen-XL보다 WorldGPT의 텍스트-비디오 정렬을 더 선호했다.
  • WorldGPT는 복잡하고 분포 외의 텍스트 프롬프트를 처리하는 데 뛰어난 성능을 보였으며, 입력 이미지에 존재하지 않는 새로운 시점 기술을 더 잘 반영한 비디오를 생성했다.
  • DOVER 점수 0.521을 기록해 강력한 프레임 수준의 품질을 입증했고, GenVideo-RefVideo SSIM 0.374를 기록해 기준 비디오와의 정렬 향상을 보였다.
  • 정성적 결과는 WorldGPT가 특히 프롬프트가 입력 이미지와 크게 다를 때 의미적 차이를 더 잘 포착함을 확인했으며, DynamiCrafter는 종종 유사한 출력을 생성하는 반면 WorldGPT는 더 높은 유사도를 유지함을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.