[論文レビュー] Unified Language-Vision Pretraining in LLM with Dynamic Discrete Visual Tokenization
本論文は、画像を離散的トークン列に変換する動的離散的視覚トークナイザーを用いて、一様な生成的目的関数のもとでテキストと併せてエンドツーエンド自己回帰的事前学習が可能な統合型言語・視覚基盤モデルLaVITを提案する。この手法は、画像をLLMが読み取れる「外国語」として扱うことで、視覚言語ベンチマークで最先端の性能を達成し、動的トークナイゼーションにより計算量を36%削減するとともに、固定長ベースラインより精度を向上させる。
Recently, the remarkable advance of the Large Language Model (LLM) has inspired researchers to transfer its extraordinary reasoning capability to both vision and language data. However, the prevailing approaches primarily regard the visual input as a prompt and focus exclusively on optimizing the text generation process conditioned upon vision content by a frozen LLM. Such an inequitable treatment of vision and language heavily constrains the model's potential. In this paper, we break through this limitation by representing both vision and language in a unified form. Specifically, we introduce a well-designed visual tokenizer to translate the non-linguistic image into a sequence of discrete tokens like a foreign language that LLM can read. The resulting visual tokens encompass high-level semantics worthy of a word and also support dynamic sequence length varying from the image. Coped with this tokenizer, the presented foundation model called LaVIT can handle both image and text indiscriminately under the same generative learning paradigm. This unification empowers LaVIT to serve as an impressive generalist interface to understand and generate multi-modal content simultaneously. Extensive experiments further showcase that it outperforms the existing models by a large margin on massive vision-language tasks. Our code and models are available at https://github.com/jy0205/LaVIT.
研究の動機と目的
- 既存のMLLMにおいて視覚が単にテキスト生成のプロンプトとして扱われるという不均衡な扱いを是正すること。
- 視覚入力をLLMの自己回帰的次トークン予測と互換性のある離散的トークン形式で表現することで、言語と視覚の統合的マルチモーダル事前学習を可能にすること。
- 画像の複雑さと意味的有用性に基づいて視覚トークンを動的に割り当てることで、計算コストと冗長性を低減すること。
- 離散的視覚トークン上で統合的生成的事前学習が、回帰ベースやアダプターベースのアプローチを上回ることを実証すること。
提案手法
- 学習可能コードブックとパッチセレクタを用いて、画像パッチを離散的視覚トークンに変換する動的視覚トークナイザーを導入する。
- 二段階のメカニズムを採用する:まず、セレクタが画像から意味的に有用なパッチを特定し、次にマージャーがそれらを可変長の離散的トークン列に圧縮する。
- 自己回帰的に次の離散的視覚トークンを予測する目的関数として交差エントロピー損失を用い、テキストトークンとの最適化目的を一致させる。
- 事前学習済みの視覚エンコーダ(例:CLIP ViT-L/14)を用いて、トークナイゼーションの前段階でパッチ特徴量を抽出し、高レベルの意味的表現を保証する。
- テキストと視覚トークンの両方に対して統一された次トークン予測目的関数を用いて、モデル全体をエンドツーエンドで訓練する。
- 学習されたコードブックは意味的に意味のある視覚トークンを生成し、例えばスケートボードの一部やキリンの模様を表すなど、解釈可能性を向上させる。
実験結果
リサーチクエスチョン
- RQ1LLMの自己回帰的学習パラダイムと互換性のある離散的トークンとしての視覚入力の表現は、効果的に可能か?
- RQ2固定長の視覚トークナイゼーションと比較して、動的トークン割り当ては効率性と性能を向上させるか?
- RQ3視覚と言語の両方のトークンに対して統一された次トークン予測目的関数を用いることで、アダプターベースや回帰ベースのMLLM手法を上回る性能が得られるか?
- RQ4連続的特徴量の回帰と比較して、離散的視覚トークナイゼーションはマルチモーダル理解と生成をどの程度向上させるか?
- RQ5学習された視覚コードの解釈可能性と意味的整合性は、標準的なViTスタイルのパッチ表現と比べてどの程度優れているか?
主な発見
- LaVITはFlickrで74.0 FID、VQAv2で57.7、OKVQAで47.6を達成し、固定長ベースラインよりそれぞれ2.9、1.2、1.2ポイント優れている。
- 動的トークナイゼーション戦略により、平均的な視覚トークン数が256から94に削減され、トレーニング時間を40%短縮し、推論コストも顕著に低減した。
- 離散的トークン予測を視覚的特徴量の回帰に置き換えると性能が低下し、統合学習における離散的トークナイゼーションの優位性を裏付けた。
- 視覚トークナイザーは有用なパッチを動的に選別し、不要な背景コンテンツをフィルタリングすることで、効率性と表現品質を向上させた。
- 学習されたコードブックは意味的に意味のある視覚トークンを生成し、例えばコード4107がスケートボードの一部、コード9146がキリンの模様を表すなど、解釈可能性を示した。
- LaVITは微調整なしで複雑な画像編集(例:ネコのひげをもった犬のポートレート)を生成でき、強力なゼロショットマルチモーダル生成能力を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。