Skip to main content
QUICK REVIEW

[論文レビュー] Adapting Object Detectors with Conditional Domain Normalization

Peng Su, Kun Wang|arXiv (Cornell University)|Mar 16, 2020
Domain Adaptation and Few-Shot Learning参考文献 48被引用数 20
ひとこと要約

本稿では、ドメイン埋め込みモジュールを用いてドメイン固有の属性を分離し、条件付き正規化を適用することでドメイン間の特徴を統合する、新たな手法である条件付きドメイン正規化(CDN)を提案する。CDNは、2Dおよび3Dの実画像同士、および合成画像から実画像へのオブジェクト検出ベンチマークにおいて、検出器の複数の特徴レベルにわたるドメインシフトを顕著に低減し、最先端の性能を達成する。

ABSTRACT

Real-world object detectors are often challenged by the domain gaps between different datasets. In this work, we present the Conditional Domain Normalization (CDN) to bridge the domain gap. CDN is designed to encode different domain inputs into a shared latent space, where the features from different domains carry the same domain attribute. To achieve this, we first disentangle the domain-specific attribute out of the semantic features from one domain via a domain embedding module, which learns a domain-vector to characterize the corresponding domain attribute information. Then this domain-vector is used to encode the features from another domain through a conditional normalization, resulting in different domains' features carrying the same domain attribute. We incorporate CDN into various convolution stages of an object detector to adaptively address the domain shifts of different level's representation. In contrast to existing adaptation works that conduct domain confusion learning on semantic features to remove domain-specific factors, CDN aligns different domain distributions by modulating the semantic features of one domain conditioned on the learned domain-vector of another domain. Extensive experiments show that CDN outperforms existing methods remarkably on both real-to-real and synthetic-to-real adaptation benchmarks, including 2D image detection and 3D point cloud detection.

研究の動機と目的

  • 異なるデータ分布間でモデルを展開した際に性能が著しく低下する現実世界のオブジェクト検出におけるドメインシフトを緩和すること。
  • ドメイン混乱学習中に、意味的コンテンツとドメイン固有の属性を混同する既存のドメイン適応手法の限界を克服すること。
  • 低レベルから高レベルの特徴まで多様な表現レベルにおいて、各段階でドメインシフトを異なる方法でモデル化することで、オブジェクト検出器のドメイン適応を実現すること。
  • 高価な現実世界のアノテーションの必要性を低減するために、合成データから実データへの適応を効果的に可能にすること。
  • ドメイン一般化の評価を目的として、2Dオブジェクト検出のための大規模な合成データから実データへのドライビングベンチマークを構築すること。

提案手法

  • ドメイン埋め込みモジュールを用いて、ドメイン固有の属性を意味的特徴から分離する。このモジュールは、ドメイン固有の特徴を表すドメインベクトルを学習する。
  • 学習されたドメインベクトルを用いて、他のドメインからの特徴を条件付きで正規化し、ドメイン属性を効果的に転送することで、共有の潜在空間における特徴の統合を実現する。
  • 検出器の複数の畳み込み段階に条件付き正規化を適用することで、表現の異なるレベルでのドメインシフトを適応的に処理する。
  • ドメイン固有の特徴を入力として使用するデコーダーネットワークを用いて、入力画像を再構成することで、ドメイン埋め込みの効果を可視化・解釈可能にする。
  • 再構成の際、バックボーンネットワークの重みは固定され、デコーダーは入力画像と再構成画像の間のL2再構成損失を最小化するように訓練される。
  • 2Dオブジェクト検出における適応性能の評価を目的として、公開データセットを用いて大規模な合成データから実データへのベンチマークを構築する。

実験結果

リサーチクエスチョン

  • RQ1ドメイン固有の属性は、意味的特徴から効果的に分離可能であり、これによりクロスドメイン特徴の統合が可能になるか?
  • RQ2学習されたドメインベクトルに基づいて条件付き正規化を適用することで、標準的なドメイン混乱手法に比べてドメイン適応性能が向上するか?
  • RQ3CDNは、オブジェクト検出器の異なる特徴表現レベルで、ドメインシフトを適応的に処理できるか?
  • RQ42Dおよび3Dオブジェクト検出において、CDNは合成データから実データへの一般化性能をどれほど発揮するか?
  • RQ5学習されたドメイン埋め込みは、画像再構成を通じて意味的なドメイン属性を捉えていると解釈できるか?

主な発見

  • CDNは、CityscapesからFoggy Cityscapesへの実画像同士の適応ベンチマークにおいて、先行手法に比べ顕著なmAP向上を達成し、最先端の性能を示した。
  • 合成データから実データへの適応において、2Dおよび3D検出タスクの両方で既存手法を上回り、合成データから実データへの強い一般化性能を示した。
  • 実ドメインの埋め込み(例:BDD100K)を用いて特徴から再構成された画像は、より現実的で、ドメイン埋め込みが意味的な現実世界の属性を捉えていることを裏付けた。
  • 可視化結果から、合成ドメインと実ドメインの特徴が共有の潜在空間において視覚的に区別できなくなることが示され、効果的なドメイン統合が実現していることが確認された。
  • オブジェクトのカテゴリが同一の場合、特徴マップにおいて両ドメインで類似した活性化パターンを示すなど、意味的整合性が保持されている。
  • KITTIの3Dポイントクラウド検出において、PointRCNNを用いてCDNは19.0の中程度のAPを達成し、3D適応において有効性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。