Skip to main content
QUICK REVIEW

[論文レビュー] HRDA: Context-Aware High-Resolution Domain-Adaptive Semantic Segmentation

Lukas Hoyer, Dengxin Dai|arXiv (Cornell University)|Apr 27, 2022
Domain Adaptation and Few-Shot Learning被引用数 7
ひとこと要約

HRDAは、高分解能の細部クロップと低分解能の文脈クロップを組み合わせ、学習可能なスケールアテンション機構を用いて、微細なディテールを保持するとともに長距離の文脈を捉える、自己教師型ドメイン適応におけるマルチスケール学習フレームワークを提案する。73.8 mIoU(GTA→Cityscapes)および65.8 mIoU(Synthia→Cityscapes)の最先端性能を達成し、それぞれSOTAを5.5および4.9 mIoU向上させつつ、GPUメモリ使用量を制御可能に保つ。

ABSTRACT

Unsupervised domain adaptation (UDA) aims to adapt a model trained on the source domain (e.g. synthetic data) to the target domain (e.g. real-world data) without requiring further annotations on the target domain. This work focuses on UDA for semantic segmentation as real-world pixel-wise annotations are particularly expensive to acquire. As UDA methods for semantic segmentation are usually GPU memory intensive, most previous methods operate only on downscaled images. We question this design as low-resolution predictions often fail to preserve fine details. The alternative of training with random crops of high-resolution images alleviates this problem but falls short in capturing long-range, domain-robust context information. Therefore, we propose HRDA, a multi-resolution training approach for UDA, that combines the strengths of small high-resolution crops to preserve fine segmentation details and large low-resolution crops to capture long-range context dependencies with a learned scale attention, while maintaining a manageable GPU memory footprint. HRDA enables adapting small objects and preserving fine segmentation details. It significantly improves the state-of-the-art performance by 5.5 mIoU for GTA-to-Cityscapes and 4.9 mIoU for Synthia-to-Cityscapes, resulting in unprecedented 73.8 and 65.8 mIoU, respectively. The implementation is available at https://github.com/lhoyer/HRDA.

研究の動機と目的

  • GPUメモリ使用量を減らすために画像をダウンスケーリングする既存の自己教師型ドメイン適応(UDA)手法の限界、特に微細なディテールの損失を是正するため。
  • 低解像度予測で失われる小規模オブジェクトのセグメンテーションおよび微細な境界ディテールを保持するため。
  • GPUメモリ消費量を増加させずにドメインシフトに強い長距離の文脈的依存関係を捉えるため。
  • 学習可能なアテンション機構を用いて、高解像度のディテールクロップと低解像度の文脈クロップの長所を統合するため。
  • 計算上の実行可能性を保ちつつ、UDAセマンティックセグメンテーション分野における最先端性能を達成するため。

提案手法

  • HRDAは1枚の画像に対して2つのクロップを用いて学習する:長距離の文脈を捉える大きな低解像度(LR)クロップと、微細なディテールを捉える小さな高解像度(HR)クロップ。
  • モデルは入力に依存する信頼度に基づき、両クロップからの予測を動的に統合する学習可能なスケールアテンションモジュールを用いる。
  • アテンション機構は、推論時に各画像領域について、LRまたはHRのどちらがより信頼できるかを学習する。
  • GPUメモリ効率を維持するため、ランダムクロップを用いて学習を行う。HRディテールクロップはLR文脈クロップ内の局所領域に焦点を当てる。
  • 追加の改善策として、ディテールブランチにおける重複するスライドクロップと、ディテールブランチへの小さな補助損失を導入し、特徴学習を強化する。
  • このフレームワークは既存のUDA手法と互換性があり、DAFormerのようなモデルにも統合可能である。

実験結果

リサーチクエスチョン

  • RQ1高解像度のディテールクロップと低解像度の文脈クロップを組み合わせることで、自己教師型ドメイン適応におけるセマンティックセグメンテーションの性能が向上するか?
  • RQ2学習可能なスケールアテンション機構は、異なる解像度からの予測を効果的に統合し、セグメンテーション精度を向上させるか?
  • RQ3マルチスケール学習により、GPUメモリ制限のもとで小規模オブジェクトの微細なディテールを保持しながら、長距離の文脈認識を維持できるか?
  • RQ4HRDAは、単純な高解像度学習や単一スケールアプローチと比較して、性能とメモリ効率の面で優れているか?
  • RQ5文脈クロップとディテールクロップが、最終的な性能向上にそれぞれどの程度寄与しているか?

主な発見

  • GTA→Cityscapesベンチマークで73.8 mIoUを達成し、前回のSOTAを5.5 mIoU上回った。
  • Synthia→Cityscapesベンチマークで65.8 mIoUを達成し、前回のSOTAを4.9 mIoU上回った。
  • 学習可能なスケールアテンション機構により、両スケールの予測を単純平均する手法と比較して+3.0 mIoUの向上を達成した。
  • 実際のHRディテールクロップを用いることで、LRクロップを双線形補間でHRにアップスケーリングする手法と比較して+1.9 mIoUの向上を示し、真の高解像度特徴の重要性を裏付けた。
  • HR₀.₇₅と呼ばれる大きなHRクロップを用いる強力なベースラインと比較しても、40%少ないGPUメモリを要しながら+3.8 mIoUの性能向上を達成した。
  • アブレーションスタディの結果、重複するディテールクロップとディテールブランチへの追加の監督が、それぞれ+0.9 mIoUおよび+1.4 mIoUの性能向上をもたらした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。