[論文レビュー] MosaicFusion: Diffusion Models as Data Augmenters for Large Vocabulary Instance Segmentation
MosaicFusionは、事前学習済みのテキストから画像への拡散モデルを用いて、トレーニング不要・ラベル監視なしに高品質な合成画像とインスタンスマスクを生成する手法を提案する。1回の拡散プロセスにおいて、画像キャンバスを複数の領域に分割し、それぞれの領域を異なるテキストプロンプトで条件づけることで、層間および時間ステップ間の集約されたクロスアテンションマップを活用し、しきい値処理とエッジに配慮した精 refinement を用いて正確なインスタンスマスクを生成する。この手法により、LVISベンチマークにおけるレアカテゴリおよびネオロジカルカテゴリの性能が顕著に向上する。
We present MosaicFusion, a simple yet effective diffusion-based data augmentation approach for large vocabulary instance segmentation. Our method is training-free and does not rely on any label supervision. Two key designs enable us to employ an off-the-shelf text-to-image diffusion model as a useful dataset generator for object instances and mask annotations. First, we divide an image canvas into several regions and perform a single round of diffusion process to generate multiple instances simultaneously, conditioning on different text prompts. Second, we obtain corresponding instance masks by aggregating cross-attention maps associated with object prompts across layers and diffusion time steps, followed by simple thresholding and edge-aware refinement processing. Without bells and whistles, our MosaicFusion can produce a significant amount of synthetic labeled data for both rare and novel categories. Experimental results on the challenging LVIS long-tailed and open-vocabulary benchmarks demonstrate that MosaicFusion can significantly improve the performance of existing instance segmentation models, especially for rare and novel categories. Code: https://github.com/Jiahao000/MosaicFusion.
研究の動機と目的
- 大語彙インスタンスセグメンテーションにおけるデータ不足の課題、特にレアカテゴリおよびネオロジカルカテゴリに対して対処すること。
- トレーニングやラベル監視を必要とする従来のデータ拡張手法の限界を乗り越えること。
- 事前学習済みのテキストから画像への拡散モデルを活用し、同時に多様で高品質な画像と対応するインスタンスマスクを生成すること。
- バックボーンアーキテクチャを変更せずに、ダウンストリームインスタンスセグメンテーションモデル向けにトレーニングフリーのデータ拡張を可能とすること。
- ロングテールおよびオープンボリュームインスタンスセグメンテーションベンチマークにおけるモデルの汎化性能と性能を向上させること。
提案手法
- 1枚の画像に複数のオブジェクトを同時に生成できるように、画像キャンバスを複数の領域に分割する。
- 全領域に対して1回の拡散プロセスを実行し、各領域を異なるテキストプロンプトで条件づけることで、多様でフォトリッチなオブジェクトインスタンスを生成する。
- 各オブジェクトのテキストプロンプトに対応する、すべてのトランスフォーマーレイヤーおよび拡散時間ステップにおけるクロスアテンションマップを抽出する。
- これらのアテンションマップを、レイヤーおよび時間ステップにわたって平均化することで、高品質で空間的に整合性のあるマスク候補を生成する。
- 集約されたアテンションマップに対してしきい値処理とエッジに配慮した精 refinement(例:バイラテラルソルバー)を適用し、正確なインスタンスマスクを生成する。
- 生成された画像-マスクペアを合成学習データとして用い、既存のインスタンスセグメンテーションモデルのファインチューニングまたは事前学習を実施する。
実験結果
リサーチクエスチョン
- RQ1事前学習済みのテキストから画像への拡散モデルを用いて、追加のトレーニングや監視なしに、正確なインスタンスマスクを備えた多様なマルチオブジェクト画像を生成できるか?
- RQ2レイヤーおよび時間ステップにわたるクロスアテンションマップの集約は、高品質なマスク予測を生成するためにどの程度有効か?
- RQ3MosaicFusionを用いて生成された合成データは、ロングテールおよびオープンボリューム設定下でのレアカテゴリおよびネオロジカルカテゴリにおけるインスタンスセグメンテーション性能をどの程度向上できるか?
- RQ4本手法は、さまざまなバックボーンアーキテクチャやインスタンスセグメンテーションモデルに一般化可能か?
- RQ51枚の画像あたりに生成するオブジェクト数が、合成データセットの品質および有用性に与える影響は何か?
主な発見
- MosaicFusionは、Mask R-CNN や Box-Supervised CenterNet2、F-VLM といった複数のベースラインモデルにおいて、レアカテゴリ(AP_r)およびネオロジカルカテゴリ(AP_novel)におけるマスクAPを顕著に向上させる。
- モデルのファインチューニングや追加監視なしに、LVISのロングテールおよびオープンボリュームベンチマークで強力な性能向上を達成する。
- レイヤーおよび時間ステップにわたるアテンションマップの集約は、個々のマップを用いる場合よりも高品質なマスク予測をもたらし、特に最終的な拡散ステップおよび高解像度レイヤーで最良の結果が得られる。
- MosaicFusionが生成する合成データセットは、最先端の性能向上を実現し、特にリソースが限られたカテゴリにおいて顕著な有効性を示しており、データが不足する状況下での本手法の有効性を裏付けている。
- 本アプローチは、さまざまなダウンストリームインスタンスセグメンテーションモデルと互換性があり、使用されるバックボーンアーキテクチャにかかわらず一貫した向上効果を示す。
- ドメインギャップが存在するものの、合成画像およびマスクは十分に現実的かつ多様であり、従来のコピー&ペーストなどの拡張技術を上回る性能を示し、ロングテール一般化において優れた学習データとして機能することが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。