[論文レビュー] Smoothing Matters: Momentum Transformer for Domain Adaptive Semantic Segmentation
本論文では、疑似ラベルと特徴量をモーメンタムネットワークを用いて平滑化することで、トレーニングのダイナミクスを安定化させるモーメンタムベースのトランスフォーマーフレームワーク、TransDAを提案する。この手法は、GTA5→CityscapesおよびSYNTHIA→Cityscapesベンチマークで最先端の性能を達成し、60.6 mIoUと+21.4の適応ゲインを達成した。
After the great success of Vision Transformer variants (ViTs) in computer vision, it has also demonstrated great potential in domain adaptive semantic segmentation. Unfortunately, straightforwardly applying local ViTs in domain adaptive semantic segmentation does not bring in expected improvement. We find that the pitfall of local ViTs is due to the severe high-frequency components generated during both the pseudo-label construction and features alignment for target domains. These high-frequency components make the training of local ViTs very unsmooth and hurt their transferability. In this paper, we introduce a low-pass filtering mechanism, momentum network, to smooth the learning dynamics of target domain features and pseudo labels. Furthermore, we propose a dynamic of discrepancy measurement to align the distributions in the source and target domains via dynamic weights to evaluate the importance of the samples. After tackling the above issues, extensive experiments on sim2real benchmarks show that the proposed method outperforms the state-of-the-art methods. Our codes are available at https://github.com/alpc91/TransDA
研究の動機と目的
- 局所的ビジョントランスフォーマー(ViTs)が強力な表現能力を有するにもかかわらず、ドメイン適応的セマンティックセグメンテーションにおいて性能が低下する理由を調査すること。
- 自己学習および敵対的適応の過程でViTベースのモデルに生じる不安定性の根本的要因、特に疑似ラベルおよび特徴量における高周波成分に起因する要因を特定すること。
- モーメンタムネットワークによる低域フィルタリング機構を提案し、ターゲットドメインの特徴量および疑似ラベル生成における学習ダイナミクスの安定化を実現すること。
- 敵対的アライメントの過程でサンプルの重要性を動的に重み付けする機構を導入することで、ドメイン一般化を向上させること。
- トレーニングの複雑さを増加させることなく、ViTベースのドメイン適応的セマンティックセグメンテーションにおける新たなSOTAベースラインを確立すること。
提案手法
- 本手法は、ソースドメインの特徴抽出器および分類器の遅延コピーを維持するモーメンタムネットワークを導入し、ターゲットドメインの疑似ラベルおよび特徴量を平滑化して生成する。
- モーメンタムネットワークは、ターゲットネットワークのパラメータに対して指数的平均を適用することで、予測値および特徴量における高周波ノイズを抑制する低域フィルタとして機能する。
- フレームワークは知識蒸留と敵対的学習を統合し、ソースモデルを教師として、ターゲットドメインにおける学生モデルの安定した監視を提供する。
- 敵対的特徴アライメントの過程で、サンプルの重要性を動的に重み付けする戦略を提案し、ロバストネスと収束性を向上させる。
- 本手法は、最小限のアーキテクチャ的変更で、標準的な自己学習および敵対的学習パイプラインに統合可能であり、CNNベースのベースラインと直接比較可能である。
実験結果
リサーチクエスチョン
- RQ1局所的ビジョントランスフォーマーは強力な表現能力を有するにもかかわらず、なぜドメイン適応的セマンティックセグメンテーションで性能を発揮できないのか?
- RQ2自己学習およびターゲットドメインにおける敵対的適応の過程で、なぜViTベースのモデルにトレーニングのダイナミクスが不安定になるのか?
- RQ3疑似ラベルおよび特徴量に対する低域フィルタリングが、ドメイン適応におけるViTベースのモデルの一般化性能および安定性を向上させられるか?
- RQ4モーメンタムベースの機構は、セマンティックセグメンテーションのような密度予測タスクにおいて、従来のルックアップテーブルベースのフィルタリングを効果的に置き換えられるか?
- RQ5特徴量アライメントの過程でサンプルに動的重み付けを施すことで、ドメイン適応性能がさらに向上するか?
主な発見
- TransDAは、GTA5→Cityscapesベンチマークで60.6 mIoUという新たなSOTAを達成し、前例の手法を大きく上回った。
- TransDAの適応ゲインは+21.4 mIoU(60.6 - 39.2)に達し、前回SOTAのProDAを+0.7上回った。
- SYNTHIA→Cityscapesベンチマークでも、62.2 mIoUのmIoUを達成し、適応ゲインは+24.5に達し、ProDAの+23.4を上回った。
- アブレーションスタディの結果、モーメンタム係数が0.999のときに最良の性能(59.3 mIoU)を示した。0.999未満または超過すると、不安定性や過剰な平滑化により性能が劣化した。
- 可視化結果から、TransDAはCNNや通常のViTと比較して、より分離され、よりロバストな特徴表現をドメイン間で生成していることが確認された。
- トレーニングの反復回数に伴う予測のフラクチュエートを抑制する点で、モーメンタムネットワークが有効であることが、連続する予測間のL1距離の低下から裏付けられた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。