Skip to main content
QUICK REVIEW

[論文レビュー] Write and Paint: Generative Vision-Language Models are Unified Modal Learners

Shizhe Diao, Wangchunshu Zhou|arXiv (Cornell University)|Jun 15, 2022
Multimodal Machine Learning Applications被引用数 5
ひとこと要約

本論文は、画像からテキストを生成する(執筆)ことと、テキストから画像を生成する(描画)ことの両方を、新しいプレフィックスマルチモーダルモデリングフレームワークを用いて同時に学習する統合的視覚言語基盤モデル、DaVinciを提案する。大規模な画像キャプションペアに対して両モダリティにプレフィックス言語モデリングを適用することで、DaVinciは27の多様な視覚、言語、マルチモーダルタスクにおいて最先端の性能を達成し、統合的マルチモーダル学習のための対称的生成的事前学習の優位性を示している。

ABSTRACT

Recent advances in vision-language pre-training have pushed the state-of-the-art on various vision-language tasks, making machines more capable of multi-modal writing (image-to-text generation) and painting (text-to-image generation). However, few studies investigate if these two essential capabilities can be learned together and boost each other, making a versatile and powerful multi-modal foundation model. In this work, we disclose the potential of symmetric generative vision-language pre-training in learning to write and paint concurrently, and propose a new unified modal model, named DaVinci, trained with prefix language modeling and prefix image modeling, a simple generative self-supervised objective on image-text pairs. Thanks to the proposed prefix multi-modal modeling framework, DaVinci is simple to train, scalable to huge data, adaptable to both writing and painting tasks, and also strong on other vision, text, and multi-modal understanding tasks. DaVinci achieves competitive performance on a wide range of 27 generation/understanding tasks and demonstrates the superiority of combining vision/language generative pre-training. Furthermore, we carefully benchmark the performance of different vision-language pre-training objectives on different scales of pre-training datasets on a heterogeneous and broad distribution coverage. Our results demonstrate the potential of exploiting self-supervision in both language and vision inputs, and establish new, stronger baselines for future comparisons at different data scales. The code and pre-trained models are available at https://github.com/shizhediao/DaVinci.

研究の動機と目的

  • 視覚と言語の生成機能を同時に学習することで、より包括的かつ強力なマルチモーダル基盤モデルを構築できるかを調査すること。
  • 画像からテキスト、テキストから画像の生成の両方を対称的に学習できる、シンプルでスケーラブルかつ統合的な事前学習フレームワークを開発すること。
  • さまざまなデータ規模とタスク分布における、視覚言語事前学習目的の有効性をベンチマークすること。
  • 今後のマルチモーダル基盤モデル研究のための、より強固で一般化可能なベースラインを確立すること。

提案手法

  • プレフィックスマルチモーダルモデリングを提案し、画像を離散トークン系列に変換することで、視覚に対してもプレフィックス言語モデリングを拡張する。
  • 1つのモデルを用いて、同じモダリティのプレフィックスと他モダリティの完全な入力を条件として、1つのモダリティのサフィックス(テキストまたは画像)を生成する。
  • 生成タスクのための人的ラベルなしに、大規模な画像キャプションペアに対してシンプルな自己教師あり生成的目的を適用する。
  • モダリティ間でパラメータを共有する標準的なトランスフォーマー基盤アーキテクチャを採用し、両方のタスク(執筆と描画)のエンドツーエンド学習を可能にする。
  • VQ-VAEに類似した方法により離散的画像トークンを活用し、画像をテキストと同じ形式で系列モデル化可能にする。
  • 統一された目的関数を用いて、大規模な画像キャプションペアデータセットでDaVinciを事前学習し、多様なタスクにおけるゼロショットおよびファインチューニング性能を実現する。

実験結果

リサーチクエスチョン

  • RQ1視覚と言語の対称的生成的事前学習が、生成および理解タスクの両方の性能向上に寄与するか?
  • RQ21つの目的関数で画像からテキスト、テキストから画像の両方の生成を学習する統合的マルチモーダルモデルが、特化型モデルを上回る性能を発揮するか?
  • RQ3さまざまなデータサイズとタスク分布における、異なる事前学習目的のスケーリング特性はいかなるものか?
  • RQ41つの基盤モデルが、視覚、言語、マルチモーダルタスクのすべてにおいて強力なゼロショットおよびファインチューニング性能を達成できるか?

主な発見

  • DaVinciは、画像からテキストへの生成、テキストから画像への生成、視覚言語理解を含む27の多様な視覚、言語、マルチモーダルタスクで最先端の性能を達成した。
  • CLEVR-Ref+およびGQAベンチマークでは、それぞれ83.92および78.81のゼロショット精度を達成し、FLAVAやSimVLMを上回った。
  • テキストから画像生成タスクではFIDスコアが17.44(ファインチューニング後は22.41)を記録し、同じベンチマークでDALL-EやOFAを上回った。
  • CIDEr最適化なしでCOCO画像キャプションタスクにおいて83.13のCIDErスコアを達成し、強力なゼロショット一般化性能を示した。
  • 広範なアブレーション実験により、提案されたプレフィックスマルチモーダルモデリング目的が、さまざまなデータスケールで非常に効果的かつスケーラブルであることが示された。
  • DaVinciは、評価されたすべてのタスクでFLAVA、SimVLM、OFAを一貫して上回り、統合的視覚言語モデルの新しい最先端ベースラインを確立した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。