[論文レビュー] WildNet: Learning Domain Generalized Semantic Segmentation from the Wild
WildNetは、ソースドメインのコンテンツとスタイルを多様でラベルなしの'ワイルド'画像へ拡張することで一般化性能を向上させる、ドメイン一般化型セマンティックセグメンテーションモデルを提案する。特徴のスタイル化、コンテンツ拡張学習、スタイル拡張学習、セマンティック一貫性正則化を活用することで、未観測のターゲットドメインで44.62%のmIoUを達成し、従来の方法がスタイルまたはコンテンツのいずれかにのみ焦点を当てていたのと比べ顕著に優れた性能を発揮する。
We present a new domain generalized semantic segmentation network named WildNet, which learns domain-generalized features by leveraging a variety of contents and styles from the wild. In domain generalization, the low generalization ability for unseen target domains is clearly due to overfitting to the source domain. To address this problem, previous works have focused on generalizing the domain by removing or diversifying the styles of the source domain. These alleviated overfitting to the source-style but overlooked overfitting to the source-content. In this paper, we propose to diversify both the content and style of the source domain with the help of the wild. Our main idea is for networks to naturally learn domain-generalized semantic information from the wild. To this end, we diversify styles by augmenting source features to resemble wild styles and enable networks to adapt to a variety of styles. Furthermore, we encourage networks to learn class-discriminant features by providing semantic variations borrowed from the wild to source contents in the feature space. Finally, we regularize networks to capture consistent semantic information even when both the content and style of the source domain are extended to the wild. Extensive experiments on five different datasets validate the effectiveness of our WildNet, and we significantly outperform state-of-the-art methods. The source code and model are available online: https://github.com/suhyeonlee/WildNet.
研究の動機と目的
- ソースドメインのコンテンツとスタイルに過剰適合することで、未観測のターゲットドメインにおけるセマンティックセグメンテーションモデルの一般化性能が著しく低下する問題に対処すること。
- 従来のドメイン一般化手法がスタイルホワイトニングやドメイン不変特徴学習にのみ焦点を当てていたという制限を克服すること。
- ラベルなしのワイルド画像を用いてコンテンツとスタイルの両方を多様化することで、ドメイン一般化特徴を学習し、モデルのロバスト性を向上させること。
- ラベルなしのターゲットデータを必要とせずに、未観測ドメインでも信頼性の高いセグメンテーション予測を可能にすること。
提案手法
- 特徴のスタイル化は、複数の層にわたり、ワイルド画像からの統計的特徴(平均と分散)をソース特徴に転送することで、スタイルの多様化を実現する。
- コンテンツ拡張学習は、固定サイズのワイルド特徴辞書を介してワイルド画像からの意味的変異を導入することで、潜在空間におけるクラス内可変性を高める。
- スタイル拡張学習は、訓練中にソース特徴にスタイル化されたワイルド特徴を組み合わせることで、ネットワークが多様なワイルドスタイルに適応するよう促進する。
- セマンティック一貫性正則化は、コンテンツとスタイルの両方がワイルド分布へ拡張されても予測が一貫性を保つように保証する。
- メモリコストを削減するため、多様なワイルドコンテンツを効率的に保存・取得できるように、均一サンプリングを用いた対照的損失を特徴辞書の構築に用いる。
実験結果
リサーチクエスチョン
- RQ1ソースドメインのコンテンツとスタイルをラベルなしのワイルド画像へ拡張することで、セマンティックセグメンテーションにおけるドメイン一般化が向上するか?
- RQ2コンテンツとスタイルの両方を多様に学習することで、スタイルまたはコンテンツのいずれかにのみ正則化を施す手法よりも一般化性能が向上するか?
- RQ3コンテンツとスタイルの両方の拡張を組み合わせることで、未観測ターゲットドメインにおけるモデルのロバスト性はどのように変化するか?
- RQ4一般化性能を最大化するために、特徴のスタイル化とコンテンツ拡張の最適な構成は何か?
主な発見
- GTAVで学習したWildNetは、Cityscapesの検証セットで44.62%のmIoUを達成し、ベースライン(35.16%)とRobustNet(36.58%)を著しく上回った。
- コンテンツとスタイルの両方をワイルドへ拡張することで、ベースライン比+5.54%の性能向上を達成し、共同多様化の有効性を実証した。
- ワイルドスタイルの統計を特徴スタイル化に用いることで、ランダムなスタイル拡張に比べ+7.27%の性能向上が得られ、自然なスタイル分布の重要性が示された。
- 393,216のサイズを持つワイルドコンテンツ辞書を用いたコンテンツ拡張は、完全な辞書を用いなくてもミニバッチ内での適用でも一般化性能を向上させ、スケーラビリティを示した。
- 深層部の特徴にスタイル化を適用すると性能がわずかに低下したため、深層部では意味的コンテンツをより強く保持する必要があることが示唆された。
- 均一サンプリングを用いたコンテンツ辞書構築は、ランダムサンプリングを上回り、より多様で代表的なコンテンツ表現が得られることを示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。