Skip to main content
QUICK REVIEW

[論文レビュー] Phase Consistent Ecological Domain Adaptation

Yanchao Yang, Dong Lao|arXiv (Cornell University)|Apr 10, 2020
Domain Adaptation and Few-Shot Learning参考文献 45被引用数 4
ひとこと要約

本稿では、画像対画像翻訳における位相一貫性を強制し、条件付き事前分布ネットワーク(CPN)を介して生態的統計を活用することで、セマンティックセグメンテーションのための新たな教師なしドメイン適応フレームワークである位相一貫生態的ドメイン適応(PCEDA)を提案する。これらの2つの事前知識をディープラーニングパイプラインに統合することで、GTA5→CityscapesおよびSinthia→Cityscapesベンチマークで最先端の性能を達成し、従来手法比で最大8.0%の向上を実現した。

ABSTRACT

We introduce two criteria to regularize the optimization involved in learning a classifier in a domain where no annotated data are available, leveraging annotated data in a different domain, a problem known as unsupervised domain adaptation. We focus on the task of semantic segmentation, where annotated synthetic data are aplenty, but annotating real data is laborious. The first criterion, inspired by visual psychophysics, is that the map between the two image domains be phase-preserving. This restricts the set of possible learned maps, while enabling enough flexibility to transfer semantic information. The second criterion aims to leverage ecological statistics, or regularities in the scene which are manifest in any image of it, regardless of the characteristics of the illuminant or the imaging sensor. It is implemented using a deep neural network that scores the likelihood of each possible segmentation given a single un-annotated image. Incorporating these two priors in a standard domain adaptation framework improves performance across the board in the most common unsupervised domain adaptation benchmarks for semantic segmentation.

研究の動機と目的

  • 密度付きアノテーションが高価である現実世界の画像におけるセマンティックセグメンテーションの課題に対処するため、豊富な合成アノテート済みデータを活用すること。
  • 特徴量または画像分布の整合性に依存するのみでないドメイン不変事前知識を組み込むことで、セマンティックセグメンテーションの教師なしドメイン適応(UDA)を改善すること。
  • 視覚生理学的知見に基づき、フーリエ領域における位相保存を強制することで、ドメイン変換中にセマンティックの一貫性を確保すること。
  • アノテートされていないターゲット画像におけるシーンレベルの規則性(生態的統計)をモデル化し、妥当なセグメンテーション仮説をガイドすること。
  • 両事前知識をエンドツーエンド微分可能なフレームワークに統合し、セマンティックセグメンテーションにおけるドメインシフトへの一般化性能を向上させること。

提案手法

  • ドメイン変換中にフーリエ変換の位相成分を保持する位相一貫画像翻訳モジュールを導入し、セマンティックコンテンツが保持されることを保証する。
  • 自然シーンの生態的統計に基づき、セグメンテーションの妥当性をスコアリングするため、シーンの適合性をモデル化する条件付き事前分布ネットワーク(CPN)を採用する。
  • トレーニング中にCPNを微分可能な事前知識として用い、アノテーションが存在しないターゲットドメインのセグメンテーション予測を正則化する。
  • 位相一貫性と生態的事前知識の正則化を統合的最適化フレームワーク内で統合し、特徴空間および出力空間の整合性を向上させる。
  • 標準的なUDA設定下で、標準的なセグメンテーションバックボーン(例:ResNet-101搭載DeepLab-V2、VGG-16、DRN-26)を用いてエンドツーエンドで手法を適用する。
  • トレーニング中にCPNを統合する際、バッチあたり1.5秒のオーバーヘッドが生じるが、推論時にはコストが一切かからないため、効率的なデプロイが可能である。

実験結果

リサーチクエスチョン

  • RQ1画像対画像翻訳における位相一貫性を強制することで、教師なしドメイン適応におけるセマンティックセグメンテーション性能が向上するか?
  • RQ2空間的規則性や形状の妥当性といった生態的統計を、アノテーションが存在しない状況でデータ依存的事前知識として効果的にモデル化できるか?
  • RQ3位相一貫性と生態的事前知識は、個別に適用した場合と組み合わせた場合に、それぞれどのようにセマンティックセグメンテーションのドメイン適応を改善するか?
  • RQ4これらの事前知識は、異なるバックボーンアーキテクチャやドメインシフトシナリオ(例:GTA5→Cityscapes、Sinthia→Cityscapes)に一般化可能か?
  • RQ5標準的なUDAパイプラインにこれらの事前知識を統合する際の計算コストはどの程度か?

主な発見

  • PCEDAはGTA5→Cityscapesベンチマークで最先端の性能を達成し、ResNet-101を用いた第二位の手法比で4.1%のmIoU向上を達成した。
  • Sinthia→Cityscapesベンチマークでは、ResNet-101を用いた場合に第二位の手法比で4.3%のmIoU向上を達成し、VGG-16を用いた場合には5.4%の向上を達成した。
  • アブレーションスタディの結果、位相一貫性とCPN事前知識の両方が性能向上に顕著に寄与しており、完全なモデルは各コンponent単体よりも優れた性能を示した。
  • 定性的な結果から、PCEDAはSOTA手法と比較して、より空間的に正則化され、シーンに整合性のあるセグメンテーションを生成することがわかった。
  • 位相一貫性を強制する計算オーバーヘッドは無視できるほど小さく(1024×512画像あたり0.001秒未満)、CPNはトレーニング時にバッチあたり1.5秒のオーバーヘッドをもたらすが、推論時にはコストが一切かからない。
  • すべての評価されたセマンティックカテゴリにおいて、mIoUとfwIoUが一貫して向上しており、クラス固有のドメインシフトに対しても頑健であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。