[論文レビュー] Label-Driven Reconstruction for Domain Adaptation in Semantic Segmentation
本稿では、セマンティックセグメンテーションにおけるドメイン適応のためのラベル駆動型再構成フレームワークを提案する。この手法は、ターゲットからソースへの翻訳を実行し、予測ラベルから直接画像を再構成することで、画像翻訳バイアスを低減する。本手法は最先端の性能を達成し、GTA5からCityscapesへの移行においてベースライン手法よりmIoUを1.3%向上させ、ResNet101およびVGG16の両バックボーンにおいて既存のSOTAを上回る性能を示した。
Unsupervised domain adaptation enables to alleviate the need for pixel-wise annotation in the semantic segmentation. One of the most common strategies is to translate images from the source domain to the target domain and then align their marginal distributions in the feature space using adversarial learning. However, source-to-target translation enlarges the bias in translated images and introduces extra computations, owing to the dominant data size of the source domain. Furthermore, consistency of the joint distribution in source and target domains cannot be guaranteed through global feature alignment. Here, we present an innovative framework, designed to mitigate the image translation bias and align cross-domain features with the same category. This is achieved by 1) performing the target-to-source translation and 2) reconstructing both source and target images from their predicted labels. Extensive experiments on adapting from synthetic to real urban scene understanding demonstrate that our framework competes favorably against existing state-of-the-art methods.
研究の動機と目的
- 合成から実都市シーンへの移行におけるセマンティックセグメンテーションにおけるドメインシフトを解消すること。
- ソースからターゲットへの翻訳手法に内在する画像翻訳バイアスと計算コストを低減すること。
- 予測ラベルから画像を再構成することで、同じ意味的カテゴリの間でクロスドメイン特徴量の整合性を強制すること。
- 統合分布整合化を通じて、ドメイン間での予測の一般化性と一貫性を向上させること。
- GTA5からCityscapesやSYNTHIAからCityscapesといった標準ベンチマークで、既存のドメイン適応手法を上回ること。
提案手法
- ターゲット画像をソースドメインの画像に類似させるために、ターゲットからソースへの画像翻訳を実行し、ソースからターゲットへの翻訳と比較して翻訳バイアスを低減するとともに、計算コストを削減する。
- 特徴表現からではなく、予測されたセマンティックラベルから直接画像を生成する再構成ネットワークを導入する。
- 再構成画像と元の画像の間の意味的ずれをペナルティ化するラベル空間再構成損失を用い、グローバルな意味的一貫性を強制する。
- 敵対的特徴整合化と再構成損失を組み合わせることで、ドメイン間の周辺分布および統合分布を両方とも整合化する。
- 微分可能な学習を可能にするために、離散的ラベルマップの近似として温度制御されたソフトラベルマッピングを採用する。
- 再構成画像の高レベルな意味的およびテクスチャの忠実度を保持するために、VGGの知覚損失とディスクラミネータ特徴一致損失を活用する。
実験結果
リサーチクエスチョン
- RQ1ターゲットからソースへの翻訳は、ソースからターゲットへの翻訳と比較して、画像翻訳バイアスを低減し、効率を向上させることができるか?
- RQ2ラベル空間で予測ラベルから直接画像を再構成することは、特徴空間での再構成と比較して、クロスドメイン特徴量の整合性をより良く実現できるか?
- RQ3ラベル駆動型画像再構成は、統合分布整合化を向上させ、セマンティックセグメンテーションにおける誤検出・見逃しを低減できるか?
- RQ4本手法は、合成から実都市シーンへのベンチマーク(GTA5-to-CityscapesやSYNTHIA-to-Cityscapes)において、最先端のドメイン適応技術を上回る性能を示せるか?
- RQ5最適なハイパーパrameter、特にソフトラベルマッピングにおける温度τの最適設定は何か?
主な発見
- ResNet101を用いたGTA5-to-Cityscapesでは、本手法が49.5 mIoUを達成し、ソースオンリーベースラインから12.9%の向上を達成した。
- VGG16を用いた場合、本手法は43.6 mIoUを達成し、ソースオンリーベースラインから25.7%の向上を達成し、CyCADAとBDLをそれぞれ8.2%と2.3%上回った。
- ターゲットからソースへの翻訳のみを適用した場合、ResNet101ではmIoUが0.6%向上、VGG16では1.0%向上した。
- ラベル空間再構成を追加することで、ResNet101ではmIoUが1.3%向上、VGG16では1.1%向上し、その有効性が裏付けられた。
- GTA5-to-Cityscapesでは、ラベル空間再構成が特徴空間再構成を2.12%上回り(43.6 vs. 41.48 mIoU)、SYNTHIA-to-Cityscapesでも0.97%上回った(41.1 vs. 40.13 mIoU)。
- 最適な温度ハイパーパrameter τは0.001であると特定され、すべての実験で最高のmIoUを達成した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。