[논문 리뷰] Mora: Enabling Generalist Video Generation via A Multi-Agent Framework
Mora는 프롬프트 향상, 이미지 생성, 영상 합성, 영상 편집 등의 전문화된 에이전트로 작업을 분해하는 다중 에이전트 프레임워크를 제안한다. 이는 텍스트에서 영상 생성, 이미지에서 영상 생성, 영상 연장, 디지털 월드 시뮬레이션 등 다양한 작업에서 Sora 수준의 능력을 달성하며, Sora에 비해 품질과 길이 면에서 격차가 있지만 강력한 성능을 보인다.
Text-to-video generation has made significant strides, but replicating the capabilities of advanced systems like OpenAI Sora remains challenging due to their closed-source nature. Existing open-source methods struggle to achieve comparable performance, often hindered by ineffective agent collaboration and inadequate training data quality. In this paper, we introduce Mora, a novel multi-agent framework that leverages existing open-source modules to replicate Sora functionalities. We address these fundamental limitations by proposing three key techniques: (1) multi-agent fine-tuning with a self-modulation factor to enhance inter-agent coordination, (2) a data-free training strategy that uses large models to synthesize training data, and (3) a human-in-the-loop mechanism combined with multimodal large language models for data filtering to ensure high-quality training datasets. Our comprehensive experiments on six video generation tasks demonstrate that Mora achieves performance comparable to Sora on VBench, outperforming existing open-source methods across various tasks. Specifically, in the text-to-video generation task, Mora achieved a Video Quality score of 0.800, surpassing Sora 0.797 and outperforming all other baseline models across six key metrics. Additionally, in the image-to-video generation task, Mora achieved a perfect Dynamic Degree score of 1.00, demonstrating exceptional capability in enhancing motion realism and achieving higher Imaging Quality than Sora. These results highlight the potential of collaborative multi-agent systems and human-in-the-loop mechanisms in advancing text-to-video generation. Our code is available at \url{https://github.com/lichao-sun/Mora}.
연구 동기 및 목표
- OpenAI의 Sora처럼 닫힌 소스이지만 대부분의 연구자들이 접근할 수 없는 일반화된 영상 생성 모델의 부재를 보완한다.
- 10초를 초과해도 장기적이고 고해상도이며 시간적으로 일관된 영상 생성에 어려움을 겪는 기존 영상 모델의 한계를 극복한다.
- 텍스트에서 영상 생성, 이미지에서 영상 생성, 영상 연장, 편집, 연결, 디지털 월드 시뮬레이션 등 광범위한 영상 생성 작업을 협업 기반의 에이전트 아키텍처로 지원한다.
- 모듈러하고 유연한 에이전트 파이프라인을 통해 Sora의 일반화된 능력을 유지하면서도 시각적 품질과 지시어 준수 능력을 보존한다.
- 연구 및 혁신을 촉진하기 위해 투명하고 오픈소스이며 확장 가능한 프레임워크를 제공한다.
제안 방법
- 영상 생성을 다섯 가지 핵심 하위작업으로 분해: 프롬프트 향상, 텍스트에서 이미지 생성, 조건부 텍스트를 이용한 이미지 정밀화, 이미지에서 영상 생성, 영상 연결.
- 각 하위작업에 전문화된 에이전트를 배치하고, 루프 및 순열 기반의 작업 실행을 통해 동적으로 파이프라인을 조율한다.
- 고해상도 이미지 및 영상 생성을 위한 기본 구성 요소로 사전 훈련된 시각-언어 모델(예: 텍스트에서 이미지 생성 디퓨전 모델)을 활용한다.
- 추론 중 에이전트 간의 적응형 라우팅과 피드백을 가능하게 하는 메타프로그래밍 접근 방식을 통해 다중 에이전트 간 협업을 통합한다.
- 반복적 정밀화 및 조건화를 적용해 생성된 영상 간 시간적 일관성과 시각적 일관성을 유지한다.
- 새로운 에이전트나 모델을 즉시 통합할 수 있는 모듈러한 파이프라인 아키텍처를 활용해 功能 확장을 가능하게 한다.
실험 결과
연구 질문
- RQ1오픈소스 구성 요소를 사용해 다중 에이전트 프레임워크가 Sora의 일반화된 영상 생성 능력을 재현할 수 있는가?
- RQ2협업 기반의 에이전트 시스템은 텍스트에서 영상 생성, 이미지에서 영상 생성, 영상 연장, 편집 등 다양한 영상 생성 작업에서 얼마나 잘 수행되는가?
- RQ3영상 품질, 길이, 지시어 준수 능력 측면에서 오픈소스 다중 에이전트 시스템과 Sora와 같은 닫힌 소스 최첨단 모델 간의 성능 격차는 어느 정도인가?
- RQ4중간 단계의 시각적 출력(예: 이미지)이 종단 간 영상 생성의 정밀도와 일관성에 얼마나 기여하는가?
- RQ5사람의 선호도는 이러한 프레임워크의 출력과 얼마나 일치하는가, 그리고 물리적 현실성과 운동 제어에서의 한계는 무엇인가?
주요 결과
- Mora는 텍스트 프롬프트에서 고해상도(1024×576), 시간적으로 일관된 최대 12초(75 프레임) 영상을 성공적으로 생성하며, 특정 작업에서는 Sora 수준의 시각적 품질을 달성한다.
- 이 프레임워크는 여섯 가지 일반화된 영상 생성 작업을 지원한다: 텍스트에서 영상 생성, 텍스트 조건부 이미지에서 영상 생성, 영상 연장, 영상 간 편집, 영상 연결, 디지털 월드 시뮬레이션.
- Mora는 지시어 준수 능력과 시각적 다양성에서 뛰어난 성능을 보이며, 입력 조건의 스타일과 콘텐츠를 유지하지만, 속도나 방향과 같은 정밀한 운동 역학을 다루는 데 어려움을 겪는다.
- 그럼에도 불구하고 Mora는 12초를 초과하는 영상 생성 및 그 이상의 지속 기간 동안 고해상도를 유지하는 데 있어 Sora와 비교해 뚜렷한 성능 격차를 보인다.
- 사람의 선호도 평가 결과, 논리적이지 않은 전환(예: 남성에서 여성으로의 인물 분해) 등의 일관성 없는 현상이 드러나, 더 나은 물리적 현실성과 인간의 시각적 기대와의 일치가 필요함을 시사한다.
- 다중 에이전트 접근 방식은 탄력적이고 모듈러하며 확장 가능한 영상 생성 파이프라인을 가능하게 하여, Sora와 같은 닫힌 소스 모델에 대한 실질적인 오픈소스 대안을 제공한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.