[論文レビュー] Multi-Source Domain Adaptation with Collaborative Learning for Semantic Segmentation
本論文は、協調学習と単純な画像変換を用いてドメインシフトを低減する、セマンティックセグメンテーションのためのマルチソースドメイン適応フレームワークを提案する。LAB色空間におけるソースドメインの画像をターゲットドメインのスタイルにあわせ、疑似ラベルを用いたクロスドメイン協調学習を活用することで、GTA5とSynscapesをソースとして用いた場合にCityscapesで59.0%のmIoUを達成し、従来の単一およびマルチソースの教師なしドメイン適応手法をすべて上回る性能を発揮する。
Multi-source unsupervised domain adaptation~(MSDA) aims at adapting models trained on multiple labeled source domains to an unlabeled target domain. In this paper, we propose a novel multi-source domain adaptation framework based on collaborative learning for semantic segmentation. Firstly, a simple image translation method is introduced to align the pixel value distribution to reduce the gap between source domains and target domain to some extent. Then, to fully exploit the essential semantic information across source domains, we propose a collaborative learning method for domain adaptation without seeing any data from target domain. In addition, similar to the setting of unsupervised domain adaptation, unlabeled target domain data is leveraged to further improve the performance of domain adaptation. This is achieved by additionally constraining the outputs of multiple adaptation models with pseudo labels online generated by an ensembled model. Extensive experiments and ablation studies are conducted on the widely-used domain adaptation benchmark datasets in semantic segmentation. Our proposed method achieves 59.0\% mIoU on the validation set of Cityscapes by training on the labeled Synscapes and GTA5 datasets and unlabeled training set of Cityscapes. It significantly outperforms all previous state-of-the-arts single-source and multi-source unsupervised domain adaptation methods.
研究の動機と目的
- 合成ソースドメイン(例:GTA5、Synscapes)と実世界のターゲットドメイン(例:Cityscapes)の間のドメインシフトの課題に対処すること。
- 単一のソースに依存するのではなく、複数のラベル付きソースドメインを活用することで、モデルの汎化性能を向上させること。
- 複雑な敵対的訓練を避けながら、ドメイン不変なセマンティックコンテキストとラベルなしターゲットデータを効果的に活用する手法を開発すること。
- セマンティックセグメンテーションにおけるマルチソース教師なしドメイン適応で最先端の性能を達成すること。
提案手法
- ソースドメインとターゲットドメインの画素分布を一致させるために、LAB色空間におけるターゲットドメインのスタイルにソース画像を変換する単純な画像変換手法を用いる。
- ラベル付きソースドメイン間で協調学習を適用し、各モデルが異なるソースドメインで訓練された他のモデルからのソフトな監督を受ける。
- ターゲットドメインの適応には、複数のソースモデルのアンサンブルによってオンラインで疑似ラベルを生成し、複数の適応ヘッドの出力を共同で制約する。
- ドメイン整合性とセマンティック整合性を最適化するために、エンドツーエンドおよび段階的トレーニング戦略を併用する。
- 敵対的訓練やカリキュラム学習のような複雑なコンponentsを避けて、効率的で微分可能な色空間変換とモデル distillation に依存する。
実験結果
リサーチクエスチョン
- RQ1LAB色空間における単純な画像変換手法は、合成画像と実世界画像の間のドメインシフトをセマンティックセグメンテーションで効果的に低減できるか?
- RQ2ターゲットドメインデータにアクセスせずに、複数のラベル付きソースドメイン間での協調学習は、一般化性能をどのように向上させるか?
- RQ3疑似ラベル付きターゲットデータを用いた共同最適化は、適応性能をどの程度向上させるか?
- RQ4提案手法は、従来の単一およびマルチソースドメイン適応アプローチを上回るか?
主な発見
- GTA5とSynscapesをソースとして用いた場合、Cityscapesの検証セットで59.0%のmIoUを達成し、すべての先行研究の最先端手法を大きく上回る。
- 3つのソース(GTA5、Synscapes、SYNTHIA)から適応した場合、16カテゴリで62.24%のmIoUを達成し、最良の単一ソースベースライン比で13%の向上を示した。
- ソースドメイン間での協調学習は、ターゲットドメインへの適応のみよりもより大きな性能向上に寄与しており、ソースのみの協調学習設定でも54.03%のmIoUを達成した。
- トラック、バス、列車などの剛体オブジェクトにおいて優れた結果を示しており、形状および空間的レイアウトの不変性を効果的に学習していることが示唆される。
- 敵対的訓練、自己訓練、カリキュラム学習を一切使用せず、効率的な色空間変換とモデル distillation に依存することで、最先端の性能を達成した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。