[論文レビュー] Jointly Training Large Autoregressive Multimodal Models
本論文は、70億パラメータのテキスト専用言語モデル(LLM)と70億パラメータのテキスト対画像モデルを統合し、統一されたアーキテクチャにしたJoint Autoregressive Mixture(JAM)フレームワークを紹介する。独自に整備したデータセットを用いたデータ効率の良いインstructチューニング戦略により、得られたJAM-Crossモデルは、一貫性があり入れ違いのテキストと画像出力を生成するというタスクにおいて最先端の性能を達成し、このタスクに明示的に設計された最初のモデルである。
In recent years, advances in the large-scale pretraining of language and text-to-image models have revolutionized the field of machine learning. Yet, integrating these two modalities into a single, robust model capable of generating seamless multimodal outputs remains a significant challenge. To address this gap, we present the Joint Autoregressive Mixture (JAM) framework, a modular approach that systematically fuses existing text and image generation models. We also introduce a specialized, data-efficient instruction-tuning strategy, tailored for mixed-modal generation tasks. Our final instruct-tuned model demonstrates unparalleled performance in generating high-quality multimodal outputs and represents the first model explicitly designed for this purpose.
研究の動機と目的
- 分離されたテキスト生成モデルと画像生成モデルを統合し、一貫性があり入れ違いのテキストと画像出力を生成できる単一の統合マルチモーダルモデルを構築するという課題に対処すること。
- テキスト専用LLMとテキスト対画像モデルという、異なる事前学習目的を持つ大規模自己回帰的モデルを統合するためのモジュラでデータ効率の良い手法を開発すること。
- 重み平均化と幅の連結を用いて、デコーダー専用のトランスフォーマアーキテクチャ間の深層的モデル統合の可能性を示すこと。
- 画像生成タスクに焦点を当てた独自のデータセットを用いて、混合モダリティ生成に特化したインストラクションチューニング戦略を考案すること。
- 長期間にわたる、テキストと画像の成分が整合するマルチモーダルコンテンツを生成できる、類例のない大規模マルチモーダルモデルを確立すること。
提案手法
- JAMフレームワークは、同じデコーダー専用トランスフォーマアーキテクチャに基づく2つの事前学習済み70億パラメータの自己回帰的モデル——テキスト専用LLM(Molybog et al., 2023)とテキスト対画像モデル(CM3leon, Yu et al., 2023)——を統合する。
- モデル統合は単純な重み平均化により実施される:$\bm{\theta}_{\text{average}} = \frac{1}{2}\bm{\theta}_{\text{llm}} + \frac{1}{2}\bm{\theta}_{\text{img}}$、これによりJAM-Uniform初期化が得られる。
- 幅の連結を用いて、260億パラメータのより広い統合モデルを構築し、隠れ層次元を2倍に拡大して$d_{\text{joint}} = 8192$とする。アテンション重みは、元のモデル重みを組み合わせたブロック行列として初期化される。
- モダリティの整合性を図り、連合生成を可能にするために、テキストのみのサンプルと画像付きテキストサンプルのハイブリッドデータセットを用いた継続的事前学習により、統合モデルをファインチューニングする。
- 画像生成に焦点を当てた、独自に整備したマルチモーダルインストラクションデータセットを用いた、特化したインストラクションチューニング手順を適用し、モデルが入れ違いのテキストと画像出力を生成できるようにする。
- ビジョンと言語の表現間の双方向的相互作用を可能にするために、クロスアテンション機構が採用され、Flamingoのような単方向的手法とは明確に区別される。

実験結果
リサーチクエスチョン
- RQ1別々に訓練されたテキスト生成用と画像生成用の大規模自己回帰的モデルを、個々の強みを保持したまま、一貫性のある連合マルチモーダル生成を可能にする単一のアーキテクチャに効果的に統合できるか?
- RQ2整備済みのマルチモーダルインストラクションデータセットを用いたデータ効率の良いインストラクションチューニングが、一貫性があり入れ違いのテキストと画像出力を生成する能力を顕著に向上させるか?
- RQ3幅の連結と重み平均化が、異なるモダリティと事前学習目的を持つ大規模で高パラメータのモデルの安定的かつ効果的な連合トレーニングを可能にするか?
- RQ4連合モデルが、個々の親モデルに存在しなかった、マルチモーダル生成におけるエメrgェントな能力をどの程度示すか?
- RQ5得られたモデルの性能は、複雑で長期間にわたる、入れ違いのテキストと画像コンテンツを生成するという点で、既存のマルチモーダルモデルと比較してどうか?
主な発見
- JAMフレームワークは、70億パラメータのテキスト専用LLMと70億パラメータのテキスト対画像モデルを、一貫性があり入れ違いのテキストと画像出力を生成できる単一の統合アーキテクチャに効果的に統合した。
- インストラクションチューニングを施したJAM-Crossモデルは、マルチモーダル生成分野で最先端の性能を達成し、生成されたテキストと画像の間の整合性と一貫性が顕著に優れていることを示した。
- 親モデルの元の事前学習データの1%未満を用いても、連合トレーニングプロセスは非常にデータ効率的でありながら、高い性能を維持した。
- モデルは、テキストと画像の成分が複雑に整合する長期間のマルチモーダルコンテンツを生成する能力を示し、これは個々の親モデルには存在しなかったエメrgェントな能力である。
- 幅の連結法により、260億パラメータの統合モデルを効果的にスケーリングでき、重み平均化のみに比べて安定したトレーニングと、マルチモーダル生成性能の向上が達成された。
- 画像生成に焦点を当てた独自に整備したインストラクションチューニングデータセットは、非常に効果的であった。わずか1,000件の慎重に選別されたサンプルでも、このマルチモーダル環境で優れた性能を発揮した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。