Skip to main content
QUICK REVIEW

[論文レビュー] DALL-E for Detection: Language-driven Compositional Image Synthesis for Object Detection

Yunhao Ge, Jiashu Xu|arXiv (Cornell University)|Jun 20, 2022
Multimodal Machine Learning Applications被引用数 7
ひとこと要約

本論文では、DALL-Eを用いて、物体検出のための高品質で多様性に富み、正確にラベル付けされた学習データを生成する、言語駆動型で構成的(コンポジショナル)な画像合成フレームワークを提案する。テキストプロンプトと画像キャプションを介して前景マスク生成と文脈画像合成を分離することで、ベースラインのカットアンドパスターよりも7.2%のmAP向上を達成し、解釈可能な言語干渉によってゼロショットおよび分布外一般化を可能にする。

ABSTRACT

We propose a new paradigm to automatically generate training data with accurate labels at scale using the text-toimage synthesis frameworks (e.g., DALL-E, Stable Diffusion, etc.). The proposed approach decouples training data generation into foreground object mask generation and background (context) image generation. For foreground object mask generation, we use a simple textual template with object class name as input to DALL-E to generate a diverse set of foreground images. A foreground-background segmentation algorithm is then used to generate foreground object masks. Next, in order to generate context images, first a language description of the context is generated by applying an image captioning method on a small set of images representing the context. These language descriptions are then used to generate diverse sets of context images using the DALL-E framework. These are then composited with object masks generated in the first step to provide an augmented training set for a classifier. We demonstrate the advantages of our approach on four object detection datasets including on Pascal VOC and COCO object detection tasks. Furthermore, we also highlight the compositional nature of our data generation approach on out-of-distribution and zero-shot data generation scenarios.

研究の動機と目的

  • 物体検出のための人的ラベル付けデータセットの高コストとスケーラビリティの制限を解決すること。
  • 自動的でスケーラブルかつプライバシー保護が可能な、多様で高品質な学習画像と正確なバウンディングボックスラベルを生成すること。
  • DALL-Eのようなテキストから画像へのモデルの構成的で説明可能な性質を活用し、分布外およびゼロショットのシナリオにおいても堅牢なデータ合成を実現すること。
  • 人的ラベル付けや3Dモデリングに依存することを減らし、言語を構成的インターフェースとして用いてデータ生成を実現すること。

提案手法

  • DALL-Eを用いて、単純なテキストプロンプト(例:「純粋な背景に猫の画像」)から多様な前景オブジェクト画像を生成する。
  • 背景・前景のセグメンテーションアルゴリズムを適用し、DALL-Eが生成した画像から正確なオブジェクトマスクを抽出する。
  • 実際のまたは合成された文脈画像の小さな集合に対して画像キャプションを適用し、文脈記述を生成する。
  • 生成された言語記述をプロンプトとしてDALL-Eに使用し、多様で文脈的に整合性のある背景画像を合成する。
  • カットアンドパスターベースの戦略を用いて、前景マスクを合成された背景画像に合成し、拡張された学習データを構築する。
  • キャプションを編集することで言語ベースの干渉を可能にし(例:「人々」のような干渉要因を削除)、文脈の関連性とモデルの一般化性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1DALL-Eのようなテキストから画像へのモデルを用いて、人的関与を最小限に抑え、スケーラブルで高品質かつ正確にラベル付けされた物体検出のための学習データを生成できるか?
  • RQ2言語駆動型の文脈画像生成は、現実世界の文脈画像と比較して、検出性能にどのように影響するか?
  • RQ3言語の構成的性質が、合成データ生成におけるゼロショットおよび分布外一般化にどの程度寄与するか?
  • RQ4言語ベースのキャプション編集は、下流の検出タスクにおける生成画像の品質と関連性を向上させることができるか?

主な発見

  • UW-kitchenの実際の文脈画像を基準として用いた場合、提案手法はオブジェクト・カットアンドパスターベースラインに対して7.2%のmAP向上を達成した。
  • 言語駆動型のDALL-Eによる文脈画像生成は、公開データセットの現実世界の文脈画像を用いる場合よりも優れた性能を示し、合成文脈の優位性を実証した。
  • 言語ベースのキャプション編集により、カートゥーンやスケッチ画像を文脈記述として用いる分布外シナリオにおいて、検出精度が最大10.2ポイント向上した。
  • 本手法は、実キッチン、カートゥーンキッチン、人物がいるシーンなど多様なテスト環境において、効果的なゼロショットおよび構成的データ生成を可能にし、性能向上が確認された。
  • 3Dモデルや手動アノテーションを一切必要とせず、高品質な画像生成と正確なラベル付けを維持でき、スケーラブルでプライバシー保護が可能なデータ合成が実現された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。