Skip to main content
QUICK REVIEW

[論文レビュー] Kosmos-G: Generating Images in Context with Multimodal Large Language Models

Xichen Pan, Li Dong|arXiv (Cornell University)|Oct 4, 2023
Computational and Text Analysis Methods被引用数 6
ひとこと要約

Kosmos-G は、テキストアーキテクチャを介して CLIP と統合された視覚言語モデルの出力空間をアライメントさせ、スコア蒸留指令微調整を用いることで、画像生成のためのマルチモodal LLM としてゼロショットで複数エンティティを対象とした画像生成を可能にする。画像デコーダーを変更せずに、U-Net 技術(例:ControlNet や LoRA)とシームレスに統合可能であり、テキストから画像への生成およびエンティティ駆動型生成の両方で最先端の性能を達成している。

ABSTRACT

Recent advancements in subject-driven image generation have made significant strides. However, current methods still fall short in diverse application scenarios, as they require test-time tuning and cannot accept interleaved multi-image and text input. These limitations keep them far from the ultimate goal of "image as a foreign language in image generation." This paper presents Kosmos-G, a model that leverages the advanced multimodal perception capabilities of Multimodal Large Language Models (MLLMs) to tackle the aforementioned challenge. Our approach aligns the output space of MLLM with CLIP using the textual modality as an anchor and performs compositional instruction tuning on curated data. Kosmos-G demonstrates an impressive capability of zero-shot subject-driven generation with interleaved multi-image and text input. Notably, the score distillation instruction tuning requires no modifications to the image decoder. This allows for a seamless substitution of CLIP and effortless integration with a myriad of U-Net techniques ranging from fine-grained controls to personalized image decoder variants. We posit Kosmos-G as an initial attempt towards the goal of "image as a foreign language in image generation." The code can be found at https://aka.ms/Kosmos-G

研究の動機と目的

  • 一般化された視覚言語から画像への生成(VL2I)におけるギャップ、特に複数エンティティ入力の分野を埋めるため。
  • 複数の画像を含む入れ違いの視覚言語プロンプトから、ゼロショットでエンティティ駆動型の画像生成を可能にするため。
  • U-Net アーキテクチャを変更せずに、マルチモーダル LLM の出力を拡散画像デコーダーにアライメントする手法を開発するため。
  • 微細調整やパーソナライズに向けた細かい制御を可能にするために、既存の U-Net 技術(例:ControlNet や LoRA)とシームレスに統合できるようにするため。

提案手法

  • モデルは「命令より前にアライメントする」戦略を採用し、最初に視覚と言語の表現を統一するためのマルチモーダル言語モデリングによる事前学習を実施する。
  • テキストモダリティをブリッジとして用い、MLLM の出力空間を CLIP のテキストエンコーダーにアンカーリングすることで、意味的アライメントを実現する。
  • スコア蒸留指令微調整を適用し、凍結された画像デコーダーからのデータ分布を蒸留することで、MLLM に微分可能な勾配を供給する。
  • キャプションとセグメンテーション済み画像の入れ違い入力を受容し、各エンティティの後にその対応する画像が続く。
  • 画像デコーダー(U-Net や VAE)にあらゆる変更を加えず、CLIP を任意の拡散ベースシステムに即座に差し替え可能なプラグアンドプレイを実現する。
  • MLLM が複数の画像とテキストを文脈的に理解・推論できる能力を活用することで、ゼロショットでのマルチエンティティ生成を実現する。

実験結果

リサーチクエスチョン

  • RQ1マルチモーダル LLM は、画像デコーダーの微調整なしに、一般化された複数画像の視覚言語入力から高精細な画像を生成できるか?
  • RQ2視覚言語モデルは、複数のエンティティにわたるゼロショットのエンティティ駆動型画像生成をどの程度うまく行えるか?
  • RQ3U-Net のアーキテクチャを変更せずに、スコア蒸留指令微調整によって拡散モデルにおける CLIP を置き換えられるか?
  • RQ4構成的命令微調整と CLIP を用いたアライメントは、画像生成の品質と忠実度にどのような影響を与えるか?
  • RQ5Kosmos-G は、ControlNet や LoRA といった既存の U-Net 技術とシームレスに統合可能で、制御性とパーソナライズ性を向上させられるか?

主な発見

  • Kosmos-G は、DreamBench スコア 10.99 を達成し、CLIP アライメントモデル(GILL-8B:12.20、Emu-14B:11.66)を上回るゼロショットのエンティティ駆動型生成性能を示した。
  • MS-COCO データセットでは、CLIP アライメント VL2I モデルの中で FID スコアが 9.34 と最低水準に抑えられ、ベース版 Stable Diffusion v1.5 と同等の性能を示した。
  • エンドツーエンドの微調整では意味のある画像が生成されないことが判明し、提案されたアライメントと命令微調整パイプラインの必要性が示された。
  • 命令微調整が行われない場合、Kosmos-G は意味的に整合した画像は生成できるが、エンティティの忠実な再現に失敗するため、微調整段階の重要性が浮き彫りになった。
  • 本モデルは、従来の手法では達成できなかったゼロショットでのマルチエンティティのエンティティ駆動型画像生成を実現した。
  • ControlNet や LoRA のバリエーションとシームレスに統合可能であり、定性的な結果から、制御性とスタイリングの向上が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。