[논문 리뷰] Movie Gen: A Cast of Media Foundation Models
Movie Gen은 대규모 이미지, 비디오, 오디오 데이터에서 Flow Matching으로 학습된 동기화 오디오를 갖춘 고품질 1080p HD 비디오, 개인화된 비디오, 정밀한 비디오 편집을 위한 기초 모델군을 제시하며, 텍스트-투-비디오, 비디오 개인화, 비디오 편집, 텍스트-투-오디오 작업에서 최신 기술 수준의 결과를 달성합니다.
We present Movie Gen, a cast of foundation models that generates high-quality, 1080p HD videos with different aspect ratios and synchronized audio. We also show additional capabilities such as precise instruction-based video editing and generation of personalized videos based on a user's image. Our models set a new state-of-the-art on multiple tasks: text-to-video synthesis, video personalization, video editing, video-to-audio generation, and text-to-audio generation. Our largest video generation model is a 30B parameter transformer trained with a maximum context length of 73K video tokens, corresponding to a generated video of 16 seconds at 16 frames-per-second. We show multiple technical innovations and simplifications on the architecture, latent spaces, training objectives and recipes, data curation, evaluation protocols, parallelization techniques, and inference optimizations that allow us to reap the benefits of scaling pre-training data, model size, and training compute for training large scale media generation models. We hope this paper helps the research community to accelerate progress and innovation in media generation models. All videos from this paper are available at https://go.fb.me/MovieGenResearchVideos.
연구 동기 및 목표
- 이미지, 비디오, 오디오를 포함한 통합적이고 확장 가능한 미디어 생성 기초 모델 세트를 개발하도록 동기를 부여한다.
- 텍스트-투-비디오, 비디오 개인화, 편집 및 오디오 생성에서 최첨단 역량을 보여준다.
- 장기 컨텍스트의 고해상도 비디오 생성을 가능하게 하는 아키텍처, 학습 방법, 데이터 큐레이션 및 추론 최적화를 기술한다.
- 베이스라인 생성 능력을 확장하기 위한 개인화 및 정밀 편집을 위한 파스트-트레이닝 절차를 소개한다.
- 미디어 생성 모델 연구를 가속화하기 위한 벤치마크와 공개 리소스를 제공한다.
제안 방법
- 확장된 이미지 및 비디오 데이터에 대해 공간-시간적으로 압축된 잠재 공간(TAE)을 사용하여 공동 이미지-비디오 기초 모델(Movie Gen Video)을 학습한다.
- 비디오 및 이미지 생성을 위한 잠재 공간의 속도를 모델링하기 위해 학습 목표로 Flow Matching을 사용한다.
- 다중 텍스트 인코더로부터의 교차 주의(conditioning)와 전체 양방향 주의를 갖춘 30B 파라미터 Transformer 백본을 도입한다.
- 동기화된 출력을 갖춘 비디오-오디오 및 텍스트-오디오 생성을 위한 13B 파라미터 Movie Gen Audio 모델을 별도로 추가한다.
- 대규모 감독 편집 데이터 세트 없이 이미지 기반 조건부 개인화와 텍스트 가이드 정밀 편집을 위한 포스트-트레이닝 절차를 구현한다.
- 비디오-투-비디오 업샘플러를 통한 공간 업샘플링(HD 1080p)과 시간 일관성을 위한 다중 확산 기법을 적용한다.
실험 결과
연구 질문
- RQ1하나의 기초 모델 프레임워크가 고품질 이미지와 비디오를 동기화된 오디오와 함께 공동으로 생성할 수 있는가?
- RQ2대규모 감독 편집 데이터가 없더라도 비디오에 대해 개인화 및 정밀 편집을 어떻게 달성할 수 있는가?
- RQ3장기 컨텍스트 비디오 생성을 위한 Flow Matching과 확산 기반 학습의 이점은 무엇인가?
- RQ4다중 모달 조건화(텍스트 프롬프트, 기준 이미지)가 생성 품질과 일관성에 어떤 영향을 미치는가?
- RQ530B-파라미터 비디오 모델을 가능하게 하는 확장성 및 효율성 전략(데이터, 컴퓨트, 병렬성)은 무엇인가?
주요 결과
- Movie Gen Video 30B 모델은 16초 길이의 HD 비디오를 16 FPS로 동기화된 오디오와 함께 생성할 수 있다.
- Movie Gen Audio 13B 모델은 음향 효과와 음악을 포함한 비디오 오디오 생성에서 최첨단 성과를 달성한다.
- 포스트 트레이닝 개인화는 특정 인물이 등장하는 비디오를 가능하게 하면서 신원을 보존한다.
- 포스트 트레이닝 정밀 편집은 텍스트 지시로 안내되는 실제 영상 또는 생성된 영상에 대한 표적 편집을 가능하게 한다.
- 이 방법은 텍스트-투-비디오 생성 및 비디오 개인화 및 편집 작업, 그리고 오디오 생성 벤치마크에서 최첨단 성능을 달성한다.
- Movie Gen Video 및 Movie Gen Audio의 벤치마크는 향후 평가를 가능하게 하기 위해 공개되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.