Skip to main content
QUICK REVIEW

[論文レビュー] VIGC: Visual Instruction Generation and Correction

Bin Wang, Fan Wu|arXiv (Cornell University)|Aug 24, 2023
Multimodal Machine Learning ApplicationsComputer Science被引用数 3
ひとこと要約

本稿では、視覚言語指令データを自己生成・自己修正することで、幻覚を著しく低減し、高品質な視覚言語指令データを生成可能なフレームワークVIGCを提案する。視覚指令生成(VIG)と反復的Q-Former更新戦略を用いた視覚指令修正(VIC)を組み合わせることで、VIGCは下流モデルの性能を向上させ、OKVQAおよびA-OKVQAで最先端の結果を達成し、1.6%の向上を実現した。

ABSTRACT

The integration of visual encoders and large language models (LLMs) has driven recent progress in multimodal large language models (MLLMs). However, the scarcity of high-quality instruction-tuning data for vision-language tasks remains a challenge. The current leading paradigm, such as LLaVA, relies on language-only GPT-4 to generate data, which requires pre-annotated image captions and detection bounding boxes, suffering from understanding image details. A practical solution to this problem would be to utilize the available multimodal large language models (MLLMs) to generate instruction data for vision-language tasks. However, it's worth noting that the currently accessible MLLMs are not as powerful as their LLM counterparts, as they tend to produce inadequate responses and generate false information. As a solution for addressing the current issue, this paper proposes the Visual Instruction Generation and Correction (VIGC) framework that enables multimodal large language models to generate instruction-tuning data and progressively enhance its quality on-the-fly. Specifically, Visual Instruction Generation (VIG) guides the vision-language model to generate diverse instruction-tuning data. To ensure generation quality, Visual Instruction Correction (VIC) adopts an iterative update mechanism to correct any inaccuracies in data produced by VIG, effectively reducing the risk of hallucination. Leveraging the diverse, high-quality data generated by VIGC, we finetune mainstream models and validate data quality based on various evaluations. Experimental results demonstrate that VIGC not only compensates for the shortcomings of language-only data generation methods, but also effectively enhances the benchmark performance. The models, datasets, and code are available at https://opendatalab.github.io/VIGC.

研究の動機と目的

  • 言語モデル(例:GPT-4)に依存しない高品質な視覚言語指令微調整データの不足に取り組むこと。
  • 高価な人手によるアノテーションに依存する従来のデータ生成手法の限界を克服し、視覚的詳細を損なわないこと。
  • マルチモーダルモデルが幻覚を低減しながら、自分自身の指令データを生成・精錬できる自己教師付きフレームワークを開発すること。
  • 複数のベンチマークおよびモデルサイズを用いた包括的な評価を通じて、VIGCが生成するデータの有効性を検証すること。

提案手法

  • VIGCは2段階のフレームワークを採用:視覚言語モデルを用いて多様な画像-質問-回答の三つ組を生成する視覚指令生成(VIG)。
  • 反復的Q-Former(IQF)更新機構を用いた視覚指令修正(VIC)により、VIGが生成した幻覚的または不正確な回答を精錬・是正する。
  • VICモジュールは、モデルの自己一貫性と知識の根拠に基づいて、回答の正確性を向上させる反復的精錬を実施する。
  • フレームワークはCOCOおよびObjects365データセットで訓練され、36,781個のVIGC-LLaVA-COCOおよび約180万個のVIGC-LLaVA-Objects365サンプルを生成した。
  • 生成されたデータはLLaVAやInstructBLIPなどのモデルの微調整に使用され、MMBench、LLaVA、OKVQA、A-OKVQAで性能が評価された。
  • 自己生成データがモデル性能を向上させ、その結果として将来のデータ品質が向上するという閉ループ学習戦略を検討した。

実験結果

リサーチクエスチョン

  • RQ1マルチモーダル大規模言語モデルは、言語中心のモデルに依存せずに、多様かつ高品質な視覚言語指令データを生成できるか?
  • RQ2反復的補正メカニズムは、自己生成マルチモーダル指令データにおける幻覚を効果的に低減できるか?
  • RQ3VIGCが生成するデータは、従来の指令微調整データを上回り、下流モデルの性能を向上させられるか?
  • RQ4VIGCが生成するデータは、外部知識を必要とするゼロショットおよびフェイシュットベンチマークでのモデル性能を向上させられるか?
  • RQ5データ生成とモデル微調整の自己改善ループは、複数の反復において持続的な性能向上をもたらすか?

主な発見

  • VIGCが生成したデータで微調整されたモデルは、MMBench、LLaVA、OKVQAでそれぞれ84.0%、85.8%、83.3%の性能を達成し、強力な一般化能力を示した。
  • VICで是正されたデータの追加により、A-OKVQAで1.6%、OKVQAで0.7%の向上が見られ、同規模のモデルで最先端の結果を達成した。
  • LLaVAとVIGCが生成したデータの混合物で微調整されたモデルは、データ量を一定に保ったままLLaVAのみで学習したモデルを上回った。
  • LLaVA-13Bを含むさまざまなモデルサイズにおいても性能向上が確認され、VIGCアプローチのスケーラビリティを裏付けた。
  • VIGCが生成したデータを用いた自己反復学習により、MMBenchおよびLLaVAの両方でモデル性能が向上し、閉ループ自己強化の可能性を示した。
  • VICモジュールは幻覚を顕著に低減しており、生のVIGデータと比較してVICで精錬されたデータの向上が顕著に見られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。