Skip to main content
QUICK REVIEW

[論文レビュー] Emu3: Next-Token Prediction is All You Need

Xinlong Wang, Xiaosong Zhang|arXiv (Cornell University)|Sep 27, 2024
Medical Imaging and Pathology Studies被引用数 4
ひとこと要約

Emu3は、次トークン予測のみを用いて訓練された統合的マルチモーダル基盤モデルであり、テキスト、画像、動画を共有離散空間にトークン化する。生成および認識タスクにおいて最先端の性能を達成しており、SDXL や LLaVA-1.6 よりも優れているが、拡散モデルや構成的アーキテクチャに依存しない。これは、次トークン予測のみで一般マルチモーダル知能を実現可能であることを示している。

ABSTRACT

While next-token prediction is considered a promising path towards artificial general intelligence, it has struggled to excel in multimodal tasks, which are still dominated by diffusion models (e.g., Stable Diffusion) and compositional approaches (e.g., CLIP combined with LLMs). In this paper, we introduce Emu3, a new suite of state-of-the-art multimodal models trained solely with next-token prediction. By tokenizing images, text, and videos into a discrete space, we train a single transformer from scratch on a mixture of multimodal sequences. Emu3 outperforms several well-established task-specific models in both generation and perception tasks, surpassing flagship models such as SDXL and LLaVA-1.6, while eliminating the need for diffusion or compositional architectures. Emu3 is also capable of generating high-fidelity video via predicting the next token in a video sequence. We simplify complex multimodal model designs by converging on a singular focus: tokens, unlocking great potential for scaling both during training and inference. Our results demonstrate that next-token prediction is a promising path towards building general multimodal intelligence beyond language. We open-source key techniques and models to support further research in this direction.

研究の動機と目的

  • 次トークン予測のみでマルチモーダルタスクにおいて最先端の性能を達成できるかどうかを調査し、拡散モデルや構成的モデルの優位性に挑戦すること。
  • 視覚、言語、動画を統一的な次トークン予測目的の下に統合することで、アーキテクチャの複雑さを排除すること。
  • テキスト、画像、動画のシーケンスの混合データからスクラッチで訓練された単一のトランスフォーマーが、生成および認識の両面で特化型モデルと同等またはそれを上回ることを実証すること。
  • モデル設計を単純化するために、訓練および推論を完全にトークンレベルの予測に集中させることで、スケーラブルなトレーニングと推論を実現すること。

提案手法

  • テキスト、画像、動画が学習可能なトークナイザーを用いて共有離散空間にトークン化され、統合的モデリングが可能になる。
  • マルチモーダルシーケンスの混合データ上で、スクラッチから訓練された単一のトランスフォーマー・デコーダーが、唯一の目的として次トークン予測を学習する。
  • モデルは、異なるモダリティからのトークンのシーケンスを統一的な自己回帰的アプローチで処理し、シーケンス内の次のトークンを予測する。
  • 動画生成は、動画フレームに対応するトークンを順次自己回帰的に予測することで達成され、高精細な動画合成が可能になる。
  • トレーニングデータには、テキスト-画像、テキスト-動画、画像-動画ペアを含む多様なマルチモーダルシーケンスが含まれており、ゼロショット一般化が可能になる。
  • 拡散モデル、対照的事前学習、モジュラー融合を回避するアーキテクチャであり、すべての機能を単に次トークン予測に依存する。

実験結果

リサーチクエスチョン

  • RQ1次トークン予測のみで、マルチモーダル生成および認識タスクにおいて最先端の性能を達成できるか?
  • RQ2単一の自己回帰的トランスフォーマーが、次トークン予測にのみ依存して、SDXL や LLaVA-1.6 といった特化型モデルを上回る性能を発揮できるか?
  • RQ3テキスト、画像、動画のシーケンスの混合データから学習した単一のモデルが、自己回帰的トークン予測によって高精細な動画を生成できるか?
  • RQ4マルチモーダルモデルにおいて、拡散モデルや構成的コンponentsを排除することで、アーキテクチャの複雑さをどの程度軽減できるか?
  • RQ5次トークン予測は、言語を越えて一般マルチモーダル知能を実現するのに十分か?

主な発見

  • Emu3は、複数のベンチマークでテキストから画像への生成において SDXL を上回り、FID および CLIP スコアがより高い。
  • Emu3は、視覚質問応答および画像キャプション生成において LLaVA-1.6 を上回り、より強力な認識能力を示している。
  • モデルは自己回帰的トークン予測により、高精細な動画を生成し、競争力のある動画生成品質を達成している。
  • Emu3は、拡散モデルや対照的事前学習を用いず、生成および認識タスクで最先端の結果を達成している。
  • 次トークン予測の目的が、多様なマルチモーダルタスクにわたる強力なゼロショット一般化を示しており、その有効性が裏付けられている。
  • 拡散ヘッドやモダリティ固有のエンコーダーといった複雑なコンponentsの排除により、トレーニングおよび推論が簡素化されつつ、性能は維持または向上している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。