Skip to main content
QUICK REVIEW

[論文レビュー] Multi-Granularity Alignment Domain Adaptation for Object Detection

Wenzhang Zhou, Dawei Du|arXiv (Cornell University)|Mar 31, 2022
Domain Adaptation and Few-Shot Learning被引用数 9
ひとこと要約

本稿では、物体検出における教師なしドメイン適応のためのマルチスケールアライメントフレームワークを提案する。ピクセル、インスタンス、カテゴリレベルの特徴アライメントを統合し、ドメイン不変表現を学習する。マルチスケール特徴集約のためのオムニスケールゲーテッドフィュージョンモジュールと、インスタンスの識別性とクロスドメインカテゴリの一貫性を向上させるカテゴリレベルのドメイン識別器を導入し、FCOSを用いたCityscapesからFoggyCityscapesへのドメイン適応でSOTAのmAP 43.8%を達成した。

ABSTRACT

Domain adaptive object detection is challenging due to distinctive data distribution between source domain and target domain. In this paper, we propose a unified multi-granularity alignment based object detection framework towards domain-invariant feature learning. To this end, we encode the dependencies across different granularity perspectives including pixel-, instance-, and category-levels simultaneously to align two domains. Based on pixel-level feature maps from the backbone network, we first develop the omni-scale gated fusion module to aggregate discriminative representations of instances by scale-aware convolutions, leading to robust multi-scale object detection. Meanwhile, the multi-granularity discriminators are proposed to identify which domain different granularities of samples(i.e., pixels, instances, and categories) come from. Notably, we leverage not only the instance discriminability in different categories but also the category consistency between two domains. Extensive experiments are carried out on multiple domain adaptation scenarios, demonstrating the effectiveness of our framework over state-of-the-art algorithms on top of anchor-free FCOS and anchor-based Faster RCNN detectors with different backbones.

研究の動機と目的

  • ソースドメインとターゲットドメインの分布差異に起因するドメインシフトを解消する。
  • ピクセル、インスタンス、カテゴリの複数のスケールで特徴をアライメントし、単一スケールの手法を超える。
  • 学習可能なゲーティング機構を用いた特徴の統合により、マルチスケール物体検出のロバスト性を向上させる。
  • カテゴリ内識別性とドメイン間カテゴリの一貫性を同時にモデル化することで、より良いドメイン一般化を実現する。
  • 最小限の計算コストで、多様なドメイン適応ベンチマークでSOTA性能を達成する。

提案手法

  • 粗い検出のガイダンスに基づき、低解像度および高解像度の特徴マップから最適な畳み込みを選び出すオムニスケールゲーテッドフィュージョンモジュールを導入し、マルチスケール特徴表現を向上させる。
  • ピクセル、インスタンス、カテゴリレベルにマルチスケールドメイン識別器を設け、ソースドメインとターゲットドメインのサンプルを区別する。カテゴリレベルの識別器はドメイン間の一貫性を強制する。
  • 高信頼度の検出結果を用いた疑似ラベル付けにより、カテゴリレベルの識別器を監視し、カテゴリ一貫性とインスタンス識別性の共同学習を可能にする。
  • バックボーンネットワークの特徴マップを用いて粗い検出を生成し、各インスタンスに対して最適な畳み込みパスの選択をガイドする。
  • 物体検出器とマルチスケールドメイン識別器を敵対的に同時に最適化する統合型の訓練目的を設計する。
  • VGG-16およびResNet-101をバックボーンとして用い、アノテーションフリー(FCOS)およびアノテーションベース(Faster R-CNN)の両検出器に本フレームワークを適用し、広範な適用可能性を示した。

実験結果

リサーチクエスチョン

  • RQ1ピクセル、インスタンス、カテゴリのスケールで同時にアライメントを実施することで、物体検出におけるドメイン一般化が向上するか?
  • RQ2学習可能なゲーティング機構を用いたマルチスケール特徴統合は、小・大インスタンスの検出性能にどのように寄与するか?
  • RQ3ソースドメインとターゲットドメイン間のカテゴリ一貫性をモデル化することで、ドメイン適応にどの程度の向上効果が得られるか?
  • RQ4各スケールレベル(ピクセル、インスタンス、カテゴリ)が全体のドメイン適応性能に果たす相対的寄与度はどの程度か?
  • RQ5本手法は、既存のSOTAドメイン適応手法と比較して、精度と効率の両面で優れているか?

主な発見

  • 本手法は、FCOSを用いたCityscapesからFoggyCityscapesへのドメイン適応ベンチマークでSOTAのmAP 43.8%を達成し、2番目に優れた手法CFAを3.6ポイント上回った。
  • カテゴリレベルの識別器を削除すると、mAPは43.6%から39.3%に著しく低下し、性能向上におけるその重要性が示された。
  • オムニスケールゲーテッドフィュージョンモジュールを導入することで、ベースラインと比較してmAPが4.3%向上し、マルチスケール特徴集約の有効性が裏付けられた。
  • カテゴリレベルの識別器は、$D^{\text{cen}}$、$D^{\text{grp}}$、$D^{\text{cls}}$ などの既存の識別器を上回り、ベースライン比で5%の向上を達成した。
  • 計算コストは妥当な水準を維持しており、Faster R-CNNではパラメータ数が255M、推論速度は21.4 FPSであり、SCLやSAPNetと比較して精度と効率の両面で優れた性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。