Skip to main content
QUICK REVIEW

[논문 리뷰] Mora: Enabling Generalist Video Generation via A Multi-Agent Framework

Zhengqing Yuan, Liu, Yixin|arXiv (Cornell University)|2024. 03. 20.
Advanced Vision and Imaging인용 수 4
한 줄 요약

Mora는 프롬프트 향상, 이미지 생성, 영상 합성, 영상 편집 등의 전문화된 에이전트로 작업을 분해하는 다중 에이전트 프레임워크를 제안한다. 이는 텍스트에서 영상 생성, 이미지에서 영상 생성, 영상 연장, 디지털 월드 시뮬레이션 등 다양한 작업에서 Sora 수준의 능력을 달성하며, Sora에 비해 품질과 길이 면에서 격차가 있지만 강력한 성능을 보인다.

ABSTRACT

Text-to-video generation has made significant strides, but replicating the capabilities of advanced systems like OpenAI Sora remains challenging due to their closed-source nature. Existing open-source methods struggle to achieve comparable performance, often hindered by ineffective agent collaboration and inadequate training data quality. In this paper, we introduce Mora, a novel multi-agent framework that leverages existing open-source modules to replicate Sora functionalities. We address these fundamental limitations by proposing three key techniques: (1) multi-agent fine-tuning with a self-modulation factor to enhance inter-agent coordination, (2) a data-free training strategy that uses large models to synthesize training data, and (3) a human-in-the-loop mechanism combined with multimodal large language models for data filtering to ensure high-quality training datasets. Our comprehensive experiments on six video generation tasks demonstrate that Mora achieves performance comparable to Sora on VBench, outperforming existing open-source methods across various tasks. Specifically, in the text-to-video generation task, Mora achieved a Video Quality score of 0.800, surpassing Sora 0.797 and outperforming all other baseline models across six key metrics. Additionally, in the image-to-video generation task, Mora achieved a perfect Dynamic Degree score of 1.00, demonstrating exceptional capability in enhancing motion realism and achieving higher Imaging Quality than Sora. These results highlight the potential of collaborative multi-agent systems and human-in-the-loop mechanisms in advancing text-to-video generation. Our code is available at \url{https://github.com/lichao-sun/Mora}.

연구 동기 및 목표

  • OpenAI의 Sora처럼 닫힌 소스이지만 대부분의 연구자들이 접근할 수 없는 일반화된 영상 생성 모델의 부재를 보완한다.
  • 10초를 초과해도 장기적이고 고해상도이며 시간적으로 일관된 영상 생성에 어려움을 겪는 기존 영상 모델의 한계를 극복한다.
  • 텍스트에서 영상 생성, 이미지에서 영상 생성, 영상 연장, 편집, 연결, 디지털 월드 시뮬레이션 등 광범위한 영상 생성 작업을 협업 기반의 에이전트 아키텍처로 지원한다.
  • 모듈러하고 유연한 에이전트 파이프라인을 통해 Sora의 일반화된 능력을 유지하면서도 시각적 품질과 지시어 준수 능력을 보존한다.
  • 연구 및 혁신을 촉진하기 위해 투명하고 오픈소스이며 확장 가능한 프레임워크를 제공한다.

제안 방법

  • 영상 생성을 다섯 가지 핵심 하위작업으로 분해: 프롬프트 향상, 텍스트에서 이미지 생성, 조건부 텍스트를 이용한 이미지 정밀화, 이미지에서 영상 생성, 영상 연결.
  • 각 하위작업에 전문화된 에이전트를 배치하고, 루프 및 순열 기반의 작업 실행을 통해 동적으로 파이프라인을 조율한다.
  • 고해상도 이미지 및 영상 생성을 위한 기본 구성 요소로 사전 훈련된 시각-언어 모델(예: 텍스트에서 이미지 생성 디퓨전 모델)을 활용한다.
  • 추론 중 에이전트 간의 적응형 라우팅과 피드백을 가능하게 하는 메타프로그래밍 접근 방식을 통해 다중 에이전트 간 협업을 통합한다.
  • 반복적 정밀화 및 조건화를 적용해 생성된 영상 간 시간적 일관성과 시각적 일관성을 유지한다.
  • 새로운 에이전트나 모델을 즉시 통합할 수 있는 모듈러한 파이프라인 아키텍처를 활용해 功能 확장을 가능하게 한다.

실험 결과

연구 질문

  • RQ1오픈소스 구성 요소를 사용해 다중 에이전트 프레임워크가 Sora의 일반화된 영상 생성 능력을 재현할 수 있는가?
  • RQ2협업 기반의 에이전트 시스템은 텍스트에서 영상 생성, 이미지에서 영상 생성, 영상 연장, 편집 등 다양한 영상 생성 작업에서 얼마나 잘 수행되는가?
  • RQ3영상 품질, 길이, 지시어 준수 능력 측면에서 오픈소스 다중 에이전트 시스템과 Sora와 같은 닫힌 소스 최첨단 모델 간의 성능 격차는 어느 정도인가?
  • RQ4중간 단계의 시각적 출력(예: 이미지)이 종단 간 영상 생성의 정밀도와 일관성에 얼마나 기여하는가?
  • RQ5사람의 선호도는 이러한 프레임워크의 출력과 얼마나 일치하는가, 그리고 물리적 현실성과 운동 제어에서의 한계는 무엇인가?

주요 결과

  • Mora는 텍스트 프롬프트에서 고해상도(1024×576), 시간적으로 일관된 최대 12초(75 프레임) 영상을 성공적으로 생성하며, 특정 작업에서는 Sora 수준의 시각적 품질을 달성한다.
  • 이 프레임워크는 여섯 가지 일반화된 영상 생성 작업을 지원한다: 텍스트에서 영상 생성, 텍스트 조건부 이미지에서 영상 생성, 영상 연장, 영상 간 편집, 영상 연결, 디지털 월드 시뮬레이션.
  • Mora는 지시어 준수 능력과 시각적 다양성에서 뛰어난 성능을 보이며, 입력 조건의 스타일과 콘텐츠를 유지하지만, 속도나 방향과 같은 정밀한 운동 역학을 다루는 데 어려움을 겪는다.
  • 그럼에도 불구하고 Mora는 12초를 초과하는 영상 생성 및 그 이상의 지속 기간 동안 고해상도를 유지하는 데 있어 Sora와 비교해 뚜렷한 성능 격차를 보인다.
  • 사람의 선호도 평가 결과, 논리적이지 않은 전환(예: 남성에서 여성으로의 인물 분해) 등의 일관성 없는 현상이 드러나, 더 나은 물리적 현실성과 인간의 시각적 기대와의 일치가 필요함을 시사한다.
  • 다중 에이전트 접근 방식은 탄력적이고 모듈러하며 확장 가능한 영상 생성 파이프라인을 가능하게 하여, Sora와 같은 닫힌 소스 모델에 대한 실질적인 오픈소스 대안을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.