Skip to main content
QUICK REVIEW

[論文レビュー] Style-Hallucinated Dual Consistency Learning for Domain Generalized Semantic Segmentation

Yuyang Zhao, Zhun Zhong|arXiv (Cornell University)|Apr 6, 2022
Domain Adaptation and Few-Shot Learning被引用数 4
ひとこと要約

本稿では、セマンティックセグメンテーションにおける合成データから実世界へのドメイン一般化のための、スタイル・ハリュシネーションを組み込んだ二重一貫性学習フレームワーク、SHADEを提案する。新規のスタイル・ハリュシネーションモジュール(SHM)を用いて、スタイル一貫性(SC)とレトロスペクティブ一貫性(RC)を導入することで、多様で現実的であるスタイル拡張された合成サンプルを生成し、それら同士および実世界の知識との間で一貫性を保証する。これにより、単一ソース設定と複数ソース設定の両方で、3つの実世界データセットにおいて平均してそれぞれ5.05%および8.35%のmIoU向上を達成し、最先端性能を実現した。

ABSTRACT

In this paper, we study the task of synthetic-to-real domain generalized semantic segmentation, which aims to learn a model that is robust to unseen real-world scenes using only synthetic data. The large domain shift between synthetic and real-world data, including the limited source environmental variations and the large distribution gap between synthetic and real-world data, significantly hinders the model performance on unseen real-world scenes. In this work, we propose the Style-HAllucinated Dual consistEncy learning (SHADE) framework to handle such domain shift. Specifically, SHADE is constructed based on two consistency constraints, Style Consistency (SC) and Retrospection Consistency (RC). SC enriches the source situations and encourages the model to learn consistent representation across style-diversified samples. RC leverages real-world knowledge to prevent the model from overfitting to synthetic data and thus largely keeps the representation consistent between the synthetic and real-world models. Furthermore, we present a novel style hallucination module (SHM) to generate style-diversified samples that are essential to consistency learning. SHM selects basis styles from the source distribution, enabling the model to dynamically generate diverse and realistic samples during training. Experiments show that our SHADE yields significant improvement and outperforms state-of-the-art methods by 5.05% and 8.35% on the average mIoU of three real-world datasets on single- and multi-source settings, respectively.

研究の動機と目的

  • 訓練時に実世界データが利用できない状況において、合成データと実世界データの間の顕著なドメインシフトを是正すること。
  • 追加の実世界データに依存せずに、ドメイン不変表現を学習することで、未学習の実世界シーンへのモデル一般化を向上させること。
  • 既存手法の限界、すなわち合成データに過剰適合するか、スタイル転送に実世界データに依存する問題を克服すること。
  • 多様なスタイル間で一貫した表現を明示的に学び、事前学習済みImageNetモデルからのレトロスペクティブなガイダンスを通じて実世界の知識と整合化すること。
  • 実世界の展開を想定した単一ソースおよび複数ソースのドメイン一般化設定において、堅牢な性能を発揮できる手法を開発すること。

提案手法

  • フレームワークは二つの一貫性制約を採用する:スタイル一貫性(SC)は、スタイル拡張された合成サンプル間で一貫した予測を強制する。レトロスペクティブ一貫性(RC)は、事前学習済みImageNetモデルの特徴とモデルの特徴を一致させ、実世界の知識を反映する。
  • 新規のスタイル・ハリュシネーションモジュール(SHM)は、特徴マップのチャネル別平均および標準偏差を操作することで、多様で現実的なスタイル拡張サンプルを生成し、空間的アライメントを保持する。
  • SHMは、ソース分布から基本スタイルを選択するために、最も遠い点抽出法(FPS)を用い、希少で多様なスタイル、特に実世界ドメインに近いスタイルをカバーする。
  • SHMは、深層層の影響を避けるために、ネットワークの初期層(例:ResNetのlayer0以降)に挿入され、スタイル表現を最大限に活用する。
  • 訓練中に進化するスタイル分布に適応するため、毎k=3エポックごとに基本スタイルを動的に再選択する。
  • 二重一貫性学習はエンドツーエンドで最適化され、SCはスタイル変動に対する不変性を促進し、RCは合成データへの過剰適合を防止する。

実験結果

リサーチクエスチョン

  • RQ1スタイル拡張された合成データは、ドメイン一般化におけるセマンティックセグメンテーションの未学習実世界シーンへの一般化を向上させ得るか?
  • RQ2訓練時に実世界ターゲットデータにアクセスできない状況で、モデルはドメイン不変表現をどのように学習できるか?
  • RQ3異なるスタイル生成戦略が、モデルの一般化性能および耐性に与える影響は何か?
  • RQ4事前学習済みImageNetモデルからのレトロスペクティブ知識は、実世界分布への一般化をどのように向上させるか?
  • RQ5多様な基本スタイルを選択するスタイル・ハリュシネーションモジュールは、一貫性学習およびモデル性能を顕著に向上させ得るか?

主な発見

  • SHADEは、単一ソースドメイン一般化設定において、3つの実世界データセットでSOTA手法を平均5.05%上回るmIoU向上を達成した。
  • 複数ソース設定では、SOTA手法を平均8.35%上回るmIoU向上を達成し、多様なソースドメインにわたる強力な一般化性能を示した。
  • アブレーションスタディにより、SHMにおけるFPSベースの基本スタイル選択が、ランダム法やK-means法を上回り、希少で多様なスタイルをよりよくカバーしていることが確認された。
  • SHMをResNetの最初のブロック(L0)の直後に挿入すると最良の性能が得られ、浅い層がより純粋なスタイル情報を保持するためである。
  • 毎3エポックごとに基本スタイルを再選択(k=3)することで、最適なスタイル多様性と性能を維持できるが、初期一回のみの選択ではmIoUが41%未満に低下する。
  • CityScapesで学習し、BDD100KやMapillary(実世界)およびGTAV、SYNTHIA(合成)ドメインに一般化させた場合、SHADEはすべてのベンチマークでISWおよびIBN-Netを上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。