[論文レビュー] FreeMask: Synthetic Images with Dense Annotations Make Stronger Segmentation Models
FreeMaskは、拡散モデルから生成された高品質で密にアノテートされた合成画像を活用することで、完全教師ありセマンティックセグメンテーションの性能を著しく向上させる。合成時にノイズの多い領域をフィルタリングし、学習が難しいセマンティックマスクを優先することで、実データ学習と同等の性能(例:ADE20Kで52.0 mIoU)を達成し、実データモデルの事前学習または共同学習によって性能を向上させる。
Semantic segmentation has witnessed tremendous progress due to the proposal of various advanced network architectures. However, they are extremely hungry for delicate annotations to train, and the acquisition is laborious and unaffordable. Therefore, we present FreeMask in this work, which resorts to synthetic images from generative models to ease the burden of both data collection and annotation procedures. Concretely, we first synthesize abundant training images conditioned on the semantic masks provided by realistic datasets. This yields extra well-aligned image-mask training pairs for semantic segmentation models. We surprisingly observe that, solely trained with synthetic images, we already achieve comparable performance with real ones (e.g., 48.3 vs. 48.5 mIoU on ADE20K, and 49.3 vs. 50.5 on COCO-Stuff). Then, we investigate the role of synthetic images by joint training with real images, or pre-training for real images. Meantime, we design a robust filtering principle to suppress incorrectly synthesized regions. In addition, we propose to inequally treat different semantic masks to prioritize those harder ones and sample more corresponding synthetic images for them. As a result, either jointly trained or pre-trained with our filtered and re-sampled synthesized images, segmentation models can be greatly enhanced, e.g., from 48.7 to 52.0 on ADE20K. Code is available at https://github.com/LiheYoung/FreeMask.
研究の動機と目的
- セマンティックセグメンテーションにおける高コストな実世界の密なアノテーションへの依存を減らすために、合成データを活用すること。
- 実際のマスク条件付き画像のみを用いて、完全教師ありセマンティックセグメンテーションの性能を向上させること。
- ピクセルレベルおよびクラスレベルでの自己適応的フィルタリングにより、合成データにおけるドメインシフトと合成誤りを解消すること。
- 学習が難しいセマンティックカテゴリの合成を優先することで、モデルの一般化性能を向上させること。
- 実データとの事前学習および共同学習の枠組みにおいて、合成データの有効性を検証すること。
提案手法
- 事前学習済みでファインチューニングされたFreestyleNetベースの拡散モデルを用い、実際のセマンティックマスクを条件として合成画像生成を行い、ドメインの整合性を確保する。
- 自己適応的ピクセルレベルフィルタリング戦略を適用:実画像事前学習モデルを用いて、クラス平均損失を上回る損失を示す領域を特定し、マスク・抑制する。
- ハードネスに配慮したデータ合成を実装:クラスごとの損失分布により識別された、より学習が難しいマスクに対して、より多くの合成画像を再サンプリングする。
- フィルタリングおよび再サンプリングされた合成画像を、実画像と併用して事前学習または共同学習に使用し、同一の訓練プロトコルを維持する。
- MMSegmentationを用いて実装し、同期バッチサンプリングとデータ拡張を伴い、8× V100 GPUで学習する。
- モデルを合成データで事前学習し、ベースの初期学習率の半分で微調整することで、完全な訓練スケジュールを保持する。
実験結果
リサーチクエスチョン
- RQ1拡散モデルから生成された、密にアノテートされた合成画像は、完全教師ありセマンティックセグメンテーションにおいて、実データ学習と同等の性能を達成できるか?
- RQ2合成データに含まれるノイズの多い領域や不適切に生成された領域を効果的にフィルタリングすることで、学習への悪影響を防げるか?
- RQ3学習が難しいセマンティックカテゴリの合成を優先することで、セグメンテーション精度に顕著な改善が得られるか?
- RQ4合成データを用いた事前学習または実データとの共同学習により、完全教師ありセグメンテーションモデルの性能が顕著に向上するか?
- RQ5合成画像生成におけるドメインシフトや不整合の影響が、下流のセグメンテーション性能に及ぼす影響は何か?
主な発見
- 合成画像のみで、ADE20Kで48.3 mIoU、COCO-Stuffで49.3 mIoUを達成し、実データベースライン(それぞれ48.5と50.5 mIoU)に近い性能を示した。
- 実データとフィルタリング済みの合成データを共同学習させたことで、ADE20KのmIoUは48.7から52.0に向上し、顕著な性能向上を示した。
- ADE20Kで最も向上したクラスは、船(+68.19 IoU)、電子レンジ(+48.72)、アーケードゲーム機(+45.85)であり、希少または複雑な物体に対して顕著な向上が見られた。
- フィルタリング機構は、境界付近や希少・小規模な物体において、ノイズの多い領域を効果的に抑制し、学習の安定性と正確性を向上させた。
- フィルタリング済みの合成データで事前学習した後、微調整することで一貫した性能向上が得られ、本手法のスケーラビリティとロバスト性を裏付けた。
- 1枚の画像の合成にはV100 GPUで約5.8秒を要するが、24台のGPUを用いれば、ADE20KおよびCOCO-Stuffの合成データセットを2日で生成可能である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。