[論文レビュー] All about Structure: Adapting Structural Information across Domains for Boosting Semantic Segmentation
本稿では、画像表現をドメイン不変の構造とドメイン特有のテクスチャに分離することで、セマンティックセグメンテーションの教師なしドメイン適応を向上させる、ドメイン不変構造抽出(DISE)というフレームワークを提案する。合成データ(GTA5)と現実世界データ(Cityscapes)のドメイン間で構造成分のみをアライメントし、画像変換とラベル転送を可能にすることで、DISEはCityscapesで45.4 mIoUを達成し、最先端手法を最大4.3 mIoU上回る性能を発揮した。
In this paper we tackle the problem of unsupervised domain adaptation for the task of semantic segmentation, where we attempt to transfer the knowledge learned upon synthetic datasets with ground-truth labels to real-world images without any annotation. With the hypothesis that the structural content of images is the most informative and decisive factor to semantic segmentation and can be readily shared across domains, we propose a Domain Invariant Structure Extraction (DISE) framework to disentangle images into domain-invariant structure and domain-specific texture representations, which can further realize image-translation across domains and enable label transfer to improve segmentation performance. Extensive experiments verify the effectiveness of our proposed DISE model and demonstrate its superiority over several state-of-the-art approaches.
研究の動機と目的
- 合成データで訓練されたモデルを現実世界の画像に適応する際のドメインシフト問題に対処すること。
- 高レベルの構造的内容と低レベルのテクスチャ差を分離することに焦点を当て、教師なしドメイン適応を向上させること。
- 画像変換中に構造的一致性を維持することで、ソース(合成)ドメインからターゲット(現実)ドメインへの有効なラベル転送を可能にすること。
- ドメイン不変構造学習とクロスドメイン画像変換の両方をサポートする統合フレームワークの開発
提案手法
- DISEフレームワークは、構造用に共有エンコーダ、テクスチャ用にドメイン特有のエンコーダを用い、分離表現学習を可能にする。
- 別々のエンコーダを介して、入力画像をドメイン不変の構造コードとドメイン特有のテクスチャコードに分解する。
- 同じデコーダを用いて、一方のドメインの構造コードと他方のドメインのテクスチャコードを組み合わせることで、画像変換を実行する。
- セグメンテーションヘッドはソースドメインのラベルで訓練され、変換されたソース画像からの疑似ラベルがターゲットドメインの教師信号として追加で使用される。
- 複数の損失関数を採用する:セグメンテーション損失、セグメンテーション予測に対する adversarial 損失、再構成損失、構造およびテクスチャ変換のサイクル整合性損失。
- 構造コードに対する adversarial 訓練によりドメイン不変の構造アライメントを達成し、一方でテクスチャはドメイン特有のままに保つ。

実験結果
リサーチクエスチョン
- RQ1高レベルの構造的内容をドメイン間で不変にできるか? これによりセマンティックセグメンテーションの一般化性能が向上するか?
- RQ2構造とテクスチャの成分を分離することで、統合特徴アライメントよりも優れたドメイン適応が達成できるか?
- RQ3構造-テクスチャ分離に基づく画像間変換により、合成画像から現実画像への有効なラベル転送が可能か?
- RQ4本手法は、最先端のドメイン適応アプローチと比較して、セグメンテーション精度において優れているか?
主な発見
- GTA5からCityscapesに適応したDISEモデルは、45.4 mIoUを達成し、『ソースオンリー』ベースラインの39.8 mIoUを著しく上回った。
- アブレーションスタディにより、ラベル転送なしに分離を実施するだけで44.1 mIoUまで向上し、構造-テクスチャ分離の価値が裏付けられた。
- 変換画像によるラベル転送は、『DISE without Label Transfer』バージョンと比較して追加で1.3 mIoUの向上をもたらし、その有効性が実証された。
- 定性的な結果から、構造が保持され、ドメイン間でテクスチャが適切に転送された高精細な画像変換が実現しており、疑似ラベル生成の可能性を裏付けた。
- 本手法は、最先端のSeg-map Adaptation手法を2.8 mIoU上回り、ドメイン適応分野における優位性を確認した。
- このフレームワークは、単一のアーキテクチャ内でドメイン不変構造学習とクロスドメイン画像変換を両立させ、セマンティックセグメンテーションにおけるドメインシフト問題に対する統合的解決策を提供した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。