Skip to main content
QUICK REVIEW

[論文レビュー] Pixel Level Data Augmentation for Semantic Image Segmentation using Generative Adversarial Networks

Shuangting Liu, Jiaqi Zhang|arXiv (Cornell University)|Nov 1, 2018
Advanced Neural Network Applications参考文献 20被引用数 7
ひとこと要約

本稿では、クラスの分布をバランスさせ、セマンティック画像セグメンテーションの精度を向上させるために、合成されたセマンティックラベルマップから現実的な画像を生成するGANベースのピクセル単位のデータ拡張手法を提案する。ラベルマップから写真のようにリアルな画像に変換するPix2PixHD GANを訓練することで、平均IoUが最大2.1%向上し、リソースが少ないクラスの精度が最大5.5%向上し、従来の手法やスタイル変換ベースの拡張手法を上回る性能を発揮した。

ABSTRACT

Semantic segmentation is one of the basic topics in computer vision, it aims to assign semantic labels to every pixel of an image. Unbalanced semantic label distribution could have a negative influence on segmentation accuracy. In this paper, we investigate using data augmentation approach to balance the semantic label distribution in order to improve segmentation performance. We propose using generative adversarial networks (GANs) to generate realistic images for improving the performance of semantic segmentation networks. Experimental results show that the proposed method can not only improve segmentation performance on those classes with low accuracy, but also obtain 1.3% to 2.1% increase in average segmentation accuracy. It shows that this augmentation method can boost accuracy and be easily applicable to any other segmentation models.

研究の動機と目的

  • セマンティック画像セグメンテーションデータセットにおける不均衡なセマンティックラベル分布の課題に対処し、希少クラスにおけるモデル性能の向上を図ること。
  • 深層生成モデリングを活用して多様で現実的なトレーニングサンプルを生成することで、特に不足しがちなクラスのセグメンテーション精度を向上させること。
  • 任意の既存のセマンティック画像セグメンテーションモデルと互換性があり、スケーラブルで即時利用可能なデータ拡張パイプラインを開発すること。
  • 異なる拡張戦略(単一ラベル、複数ラベル、再構成)および補助データの割合がセグメンテーション性能に与える影響を調査すること。

提案手法

  • 本手法では、実際の画像とそれに対応するセマンティックラベルマップのペアを用いて、ラベルマップから写真のようなリアルな画像へのマッピングを学習するPix2PixHD条件付きGANを訓練する。
  • 生成器ネットワークはセマンティックラベルマップを入力として受け取り、リアルな画像を出力する。ディスクリミネータはミニマックス損失を用いて、実際の画像とGANで生成された画像を区別する。
  • 新しいトレーニングデータは、ラベルマップの再構成によって合成される。ベースとなるラベルマップ(例:空、道路、建物)を作成し、追加のセマンティッククラス(例:壁、フェンス、電柱)を重ねて適用する。
  • これらの再構成済みラベルマップから訓練されたGANを用いて補助的な画像を生成することで、データの多様性が向上し、クラスの表現がバランスされる。
  • 最終的なトレーニングデータセットは、オリジナル画像とGANで生成された補助画像を30–70%の割合で組み合わせ、汎化性能とロバストネスを評価する。
  • セグメンテーションモデルは拡張済みデータセットでファインチューニングされ、性能評価には平均交差率(mIoU)が用いられる。

実験結果

リサーチクエスチョン

  • RQ1GANベースのピクセル単位のデータ拡張は、不足しがちなセマンティッククラスのセグメンテーション精度を効果的に向上させることができるか?
  • RQ2拡張戦略の選択(単一ラベルの重ね合わせ、複数ラベルの重ね合わせ、ラベルマップの再構成)がセグメンテーション性能に与える影響は何か?
  • RQ3セグメンテーション精度を最大化するための補助データとオリジナルデータの最適な割合は何か?
  • RQ4GANで生成されたデータは、従来のデータ拡張技術と比較して、クラス固有の性能と全体の平均IoUの両方を向上させるか?

主な発見

  • 再構成ベースの拡張手法が、79.41%という最高の平均IoUを達成し、ベースライン比で2.1%の向上を示した。
  • オリジナルのラベルマップに1つのクラス(例:壁)を追加すると、平均IoUが1.3%向上し、追加されたクラスのIoUが5.0%向上した。
  • 複数のクラス(壁、フェンス、電柱、信号機、列車)を追加すると、平均IoUが1.5%向上し、特定のクラスの精度が最大5.5%向上した。
  • 最適な補助データの割合は30%~70%の間であり、それ以上になると過学習や分布シフトの影響で性能が低下した。
  • GANベースの手法は、従来の拡張法(例:回転、ズーム)および最先端のスタイル変換ベースの拡張法を上回り、平均IoUで2.1%の向上を達成した。
  • 再構成ベースの拡張が最も優れた結果をもたらした。これは、拡張済みトレーニングセットにおけるラベル分布の多様性とバランスの高さに起因する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。