[論文レビュー] Semi-supervised Domain Adaptation based on Dual-level Domain Mixing for Semantic Segmentation
本稿では、セマンティックセグメンテーションにおける半教師付きドメイン適応のための二段階ドメイン混合フレームワークを提案する。領域レベルおよびサンプルレベルのデータ混合を組み合わせ、補完的な教師モデルを訓練し、それらが学生モデルに知識を蒸留する。本手法は、スタイル変換を用いない状態でも、疑似ラベルの反復的精錬および自己学習による教師・学生の段階的改善を通じて、GTA5からCityscapesへのベンチマークで最先端の性能を達成する。
Data-driven based approaches, in spite of great success in many tasks, have poor generalization when applied to unseen image domains, and require expensive cost of annotation especially for dense pixel prediction tasks such as semantic segmentation. Recently, both unsupervised domain adaptation (UDA) from large amounts of synthetic data and semi-supervised learning (SSL) with small set of labeled data have been studied to alleviate this issue. However, there is still a large gap on performance compared to their supervised counterparts. We focus on a more practical setting of semi-supervised domain adaptation (SSDA) where both a small set of labeled target data and large amounts of labeled source data are available. To address the task of SSDA, a novel framework based on dual-level domain mixing is proposed. The proposed framework consists of three stages. First, two kinds of data mixing methods are proposed to reduce domain gap in both region-level and sample-level respectively. We can obtain two complementary domain-mixed teachers based on dual-level mixed data from holistic and partial views respectively. Then, a student model is learned by distilling knowledge from these two teachers. Finally, pseudo labels of unlabeled data are generated in a self-training manner for another few rounds of teachers training. Extensive experimental results have demonstrated the effectiveness of our proposed framework on synthetic-to-real semantic segmentation benchmarks.
研究の動機と目的
- 合成(ソース)ドメインから現実世界(ターゲット)ドメインにセマンティックセグメンテーションを適用する際、ラベル付きターゲットデータが限られている状況における性能ギャップを解消すること。
- ラベル付きソースデータ、限られたラベル付きターゲットデータ、および豊富なラベルなしターゲットデータを組み合わせることで、教師なしドメイン適応および半教師付き学習の限界を克服すること。
- 領域レベルおよびサンプルレベルの二段階データ混合を導入することでドメインシフトを軽減し、ドメイン不変特徴の学習を促進すること。
- 補完的教師からの知識蒸留と疑似ラベル付きデータを用いた反復的自己学習により、モデルの一般化性能およびロバストネスを向上させること。
- 標準的な合成ドメインから現実ドメインへのベンチマークで本フレームワークの有効性を実証し、最小限のラベル付きターゲットデータで優れた性能を達成すること。
提案手法
- ラベル付きソースおよびターゲット画像に二つのマスクを適用し、マスク領域を組み合わせて構築された混合サンプルにより、構造的不変性を強調する領域レベルドメイン混合を提案する。
- ソースおよびターゲット画像全体を直接ブレンドすることで、包括的なドメイン不変表現学習を促進するサンプルレベルドメイン混合を導入する。
- 領域レベルの混合データから学習する教師モデルと、サンプルレベルの混合データから学習する教師モデルの二つを、ドメインシフトの異なる側面に焦点を合わせて訓練する。
- 両教師から学生モデルへの知識蒸留を実施し、「ダークナレッジ」を活用してターゲットドメインにおける一般化性能を向上させる。
- 学生モデルを用いてラベルなしターゲットデータの疑似ラベルを生成し、反復的自己学習ループで教師を再訓練することで、教師および学生の両方を段階的に精錬する。
- LAB色空間におけるスタイル変換を適用して視覚的ドメインギャップをさらに軽減するが、本手法はスタイル変換を用いない場合でも有効である。
実験結果
リサーチクエスチョン
- RQ1領域レベルおよびサンプルレベルの両方で作用する二段階ドメイン混合は、セマンティックセグメンテーションの半教師付きドメイン適応におけるドメイン一般化を向上させるか?
- RQ2異なる混合レベルで学習された二つの補完的教師からの知識蒸留は、単一教師またはベースライン手法と比較して、学生モデルの性能にどのように影響を与えるか?
- RQ3疑似ラベル付きデータを用いた反復的自己学習は、複数ラウンドの精錬を通じて、モデル性能をどの程度向上させるか?
- RQ4スタイル変換が適用されていない状況でも、本フレームワークは有効であるか?また、同じ条件下で既存手法(ASS)と比較してどのように差がつくか?
- RQ5領域レベルおよびサンプルレベルの混合の補完的強みは、特に複雑または特徴的な形状を有するセマンティックカテゴリにおいてどのように現れるか?
主な発見
- 学生モデルは、すべてのラベル付きデータ設定において、個々の教師モデルを常に上回る性能を示し、補完的視点からの知識蒸留の有効性を裏付けている。
- GTA5からCityscapesへのベンチマークにおいて、2975枚のラベル付きターゲット画像を用いた場合、本手法はスタイル変換を用いない状態でも、ASSベースラインを上回る69.8%の平均IoUを達成した。
- 二段階混合からのモデルアンサンブルは、単一ビューのアンサンブルよりも優れた性能を示し、フェンスやライダーなど困難なカテゴリのIoUが向上した。
- 領域レベル混合は構造に強く頑健なクラス(例:道路、歩道、植生)で最も優れた性能を示した一方、サンプルレベル混合は形状に敏感なクラス(例:バス、信号機)で優れた性能を示し、両者の補完的性質を確認した。
- 反復的自己学習ループにより、段階的な改善が得られた:学生の性能はラウンドを重ねるごとに向上し、より強い学生モデルがより正確な疑似ラベルを介して教師モデルを精錬した。
- スタイル変換は性能を向上させるが、本フレームワークはスタイル変換なしでも有効であり、ドメイン変換なしの100~1000枚のラベル付き画像条件下でも最先端の結果を達成した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。