Skip to main content
QUICK REVIEW

[논문 리뷰] Emu3: Next-Token Prediction is All You Need

Xinlong Wang, Xiaosong Zhang|arXiv (Cornell University)|2024. 09. 27.
Medical Imaging and Pathology Studies인용 수 4
한 줄 요약

Emu3는 다음 토큰 예측을 유일한 학습 방법으로 사용하여 텍스트, 이미지, 비디오를 공통의 이산 공간으로 토큰화하는 통합 다중모달 기초 모델을 개발한다. 이는 확산 또는 조합적 아키텍처에 의존하지 않으며, 생성 및 인식 작업 전반에서 최신 기술 수준의 성능을 달성한다. 이는 다음 토큰 예측만으로도 일반적인 다중모달 지능을 실현할 수 있음을 보여준다.

ABSTRACT

While next-token prediction is considered a promising path towards artificial general intelligence, it has struggled to excel in multimodal tasks, which are still dominated by diffusion models (e.g., Stable Diffusion) and compositional approaches (e.g., CLIP combined with LLMs). In this paper, we introduce Emu3, a new suite of state-of-the-art multimodal models trained solely with next-token prediction. By tokenizing images, text, and videos into a discrete space, we train a single transformer from scratch on a mixture of multimodal sequences. Emu3 outperforms several well-established task-specific models in both generation and perception tasks, surpassing flagship models such as SDXL and LLaVA-1.6, while eliminating the need for diffusion or compositional architectures. Emu3 is also capable of generating high-fidelity video via predicting the next token in a video sequence. We simplify complex multimodal model designs by converging on a singular focus: tokens, unlocking great potential for scaling both during training and inference. Our results demonstrate that next-token prediction is a promising path towards building general multimodal intelligence beyond language. We open-source key techniques and models to support further research in this direction.

연구 동기 및 목표

  • 다음 토큰 예측만으로도 다중모달 작업에서 최신 기술 수준의 성능을 달성할 수 있는지 조사하는 것. 이는 확산 및 조합적 모델의 지배적 우위에 도전하기 위함이다.
  • 비디오, 언어, 시각을 하나의 다음 토큰 예측 목표 아래 통합함으로써 아키텍처의 복잡성을 제거하는 것.
  • 다중모달 시퀀스에서 완전히 새로 훈련된 하나의 트랜스포머가 생성 및 인식 작업에서 전용 모델과 동일하거나 이를 초월할 수 있음을 입증하는 것.
  • 모델 설계를 단순화하기 위해 토큰 수준의 예측에 집중함으로써 훈련 및 추론의 확장성을 높이는 것.

제안 방법

  • 텍스트, 이미지, 비디오가 학습 가능한 토크나이저를 통해 공통의 이산 공간으로 토큰화되어 통합 모델링이 가능해진다.
  • 다양한 다중모달 시퀀스의 혼합 데이터에 대해 처음부터 단일 트랜스포머 디코더를 훈련하며, 다음 토큰 예측을 유일한 목표로 삼는다.
  • 모델은 다양한 모odal의 토큰 시퀀스를 통합된 자동회귀 방식으로 처리하여 시퀀스의 다음 토큰을 예측한다.
  • 비디오 생성은 비디오 프레임에 해당하는 토큰을 순차적으로 자동회귀적으로 예측함으로써 달성되며, 고해상도 비디오 합성이 가능해진다.
  • 훈련 데이터는 다양한 다중모달 시퀀스로 구성되어 있으며, 텍스트-이미지, 텍스트-비디오, 이미지-비디오 쌍을 포함하여 제로샷 일반화가 가능하다.
  • 확산, 대비적 사전학습, 모듈화된 융합 기법을 피하고, 모든 기능을 단지 다음 토큰 예측에 의존한다.

실험 결과

연구 질문

  • RQ1다음 토큰 예측만으로도 다중모달 생성 및 인식 작업에서 최신 기술 수준의 성능을 달성할 수 있는가?
  • RQ2다음 토큰 예측에만 집중한 통합 자동회귀 트랜스포머가 SDXL 및 LLaVA-1.6와 같은 전용 모델을 능가할 수 있는가?
  • RQ3텍스트, 이미지, 비디오 시퀀스의 혼합 데이터로 훈련된 단일 모델이 자동회귀적 토큰 예측을 통해 고해상도 비디오를 생성할 수 있는가?
  • RQ4다중모달 모델에서 확산 및 조합적 구성 요소를 제거함으로써 아키텍처의 복잡성이 얼마나 줄어들 수 있는가?
  • RQ5다음 토큰 예측은 언어를 넘어서 일반적인 다중모달 지능을 가능하게 하는 데 충분한가?

주요 결과

  • Emu3는 다양한 벤치마크에서 SDXL을 초월하여 텍스트-이미지 생성 작업에서 더 낮은 FID 및 더 높은 CLIP 점수를 기록한다.
  • Emu3는 시각 질문 응답 및 이미지 캡션 생성 작업에서 LLaVA-1.6를 능가하여 더 강력한 인식 능력을 보여준다.
  • 모델은 비디오 시퀀스의 토큰을 자동회귀적으로 예측함으로써 고해상도 비디오 생성을 수행하며, 경쟁 수준의 비디오 생성 품질을 달성한다.
  • Emu3는 확산 또는 대비적 사전학습을 사용하지 않으면서도 생성 및 인식 작업에서 최신 기술 수준의 성능을 달성한다.
  • 다양한 다중모달 작업에 걸쳐 강력한 제로샷 일반화 능력을 보이며, 다음 토큰 예측 목표의 강건성을 입증한다.
  • 확산 헤드나 모odal 전용 인코더와 같은 복잡한 구성 요소를 제거함으로써 훈련 및 추론 과정이 단순화되었고, 성능은 유지되거나 향상되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.