[論文レビュー] Emergence of Object Segmentation in Perturbed Generative Models
本稿では、ランダムなシフトを加えることで、生成モデルが前景・背景の分離表現を学習するように強制する摂動付き生成モデルを用いた、完全に教師なしのオブジェクトセグメンテーション手法を提案する。GAN を用いて背景、前景、マスクのレイヤー構造を持つシーンを生成し、その後に実画像をこの潜在空間に逆方向に変換するエンコーダーを用いることで、手動アノテーションや事前学習済み検出器を一切用いずに最先端の教師なしセグメンテーションを達成する。
We introduce a novel framework to build a model that can learn how to segment objects from a collection of images without any human annotation. Our method builds on the observation that the location of object segments can be perturbed locally relative to a given background without affecting the realism of a scene. Our approach is to first train a generative model of a layered scene. The layered representation consists of a background image, a foreground image and the mask of the foreground. A composite image is then obtained by overlaying the masked foreground image onto the background. The generative model is trained in an adversarial fashion against a discriminator, which forces the generative model to produce realistic composite images. To force the generator to learn a representation where the foreground layer corresponds to an object, we perturb the output of the generative model by introducing a random shift of both the foreground image and mask relative to the background. Because the generator is unaware of the shift before computing its output, it must produce layered representations that are realistic for any such random perturbation. Finally, we learn to segment an image by defining an autoencoder consisting of an encoder, which we train, and the pre-trained generator as the decoder, which we freeze. The encoder maps an image to a feature vector, which is fed as input to the generator to give a composite image matching the original input image. Because the generator outputs an explicit layered representation of the scene, the encoder learns to detect and segment objects. We demonstrate this framework on real images of several object categories.
研究の動機と目的
- 手動アノテーション、バウンディングボックス、事前学習済み検出器に依存しない完全に教師なしのオブジェクトセグメンテーション手法の開発を目的とする。
- オブジェクトセグメンテーションを、背景に対して局所的にシフトさせても現実性が保たれるという原則に基づいて定義する。
- 前景位置のランダムな摂動に対して、現実的であることを保つように、背景、前景、マスクのレイヤー構造を持つシーン表現を生成する生成モデルの訓練を目的とする。
- 事前学習済み生成器の潜在空間に実画像をマッピングするエンコーダー・ネットワークを訓練し、エンドツーエンドの教師なしセグメンテーションを可能にする。
- LSUN Cars や CUB-200 といった実世界のデータセット上で、教師なしの条件下で競争力のある mIoU スコアを達成することを示す。
提案手法
- 生成器 G と識別器 D を用いた敵対的設定で、背景 (B)、前景 (F)、マスク (m) のトリプルを入力として、現実的な合成画像を生成する生成モデルを訓練する。
- 訓練中に前景およびマスクに入力に依存しないランダムなシフト (p) を導入し、G が摂動後も有効な現実的な分離されたオブジェクトセグメンテーションを学習するように強制する。
- 事前学習済み生成器 G を自己符号化器のデコーダーとして用い、エンコーダー E が実画像を G を介して入力を再構築できる潜在コード z にマッピングする。
- 事前学習済み識別器から抽出した特徴に基づく知覚的損失と、入力画像と生成画像の差を最小化する再構築損失を用いて、エンコーダー E を訓練する。
- マルチスケールの潜在コード表現を用いる:5スケール、各スケールに2つのAdaINコード、背景・前景ごとに別々のコードを設け、合計20個の512次元潜在コードを用いる。
- 訓練済みエンコーダーを実画像に適用し、いかなる教師強化アノテーションも用いずにオブジェクトマスクを抽出する。生成器の明示的なレイヤー出力を活用する。
実験結果
リサーチクエスチョン
- RQ1前景を背景に対してランダムに空間的に摂動させた条件下で、生成モデルの訓練からオブジェクトセグメンテーションが出現するか?
- RQ2固定された事前学習済み生成器を用いた教師なし自己符号化器は、いかなる手動アノテーションも用いずに実画像内のオブジェクトを検出・セグメンテーションできるか?
- RQ3複雑なオブジェクト形状と背景を有する実データセットにおいて、本手法は教師ありベースラインと比較してどの程度の性能を示すか?
- RQ4現在の GAN がこのようなデータに限界をもつとしても、本フレームワークは複数のオブジェクトカテゴリに一般化可能か?
- RQ5セグメンテーションの品質は、生成器の逆方向変換の可能性とエンコーダー訓練の安定性にどの程度依存するか?
主な発見
- LSUN Car データセットにおいて、手動アノテーションを一切使用していないにもかかわらず、Mask R-CNN などの教師あり手法と同等の競争力ある mIoU スコアを達成した。
- CUB-200 データセットでは、教師ありアノテーションをベンチマークとして用い、mIoU 0.51 を達成し、細分化された鳥のセグメンテーションにおいて優れた性能を示した。
- 生成器の訓練時にランダムな摂動を導入することで、同一の前景・背景や空のマスクといった自明な解を防ぎ、意味のあるオブジェクトレベルの分離を学習するようモデルを強制した。
- 定性的な結果から、本モデルは、車や馬といった多様なオブジェクトカテゴリに良好に一般化しており、混合データセットで学習した場合でも有効であるが、画像品質は単一カテゴリデータに比べて低い。
- 100枚の小規模バッチで画像を処理することでエンコーダー訓練が安定化し、生成器の逆方向変換の曖昧さに対しても頑健であるが、小さなオブジェクトは依然として課題である。
- 生成された合成画像の Fréchet Inception Distance (FID) は、標準的な StyleGAN と同等であり、レイヤー構造と摂動付き訓練という追加制約があるにもかかわらず、高い現実性を示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。