Skip to main content
QUICK REVIEW

[論文レビュー] Towards Domain Generalization in Object Detection

Xingxuan Zhang, Zekai Xu|arXiv (Cornell University)|Mar 27, 2022
Domain Adaptation and Few-Shot Learning被引用数 16
ひとこと要約

本稿では、領域一般化のためのオブジェクト検出(DGOD)を導入し、領域不変特徴と領域固有特徴の間の誤った相関を軽減するために、提案領域レベルのサンプル重みを学習する新規手法であるRegion Aware Proposal reweighTing(RAPT)を提案する。RAPTは、多様で未知の分布シフトに対して検出器の一般化性能を著しく向上させ、密度、文脈、ランダムシフトを含む複数のクロスデータセットベンチマークで最先端の手法を上回る性能を示す。

ABSTRACT

Despite the striking performance achieved by modern detectors when training and test data are sampled from the same or similar distribution, the generalization ability of detectors under unknown distribution shifts remains hardly studied. Recently several works discussed the detectors' adaptation ability to a specific target domain which are not readily applicable in real-world applications since detectors may encounter various environments or situations while pre-collecting all of them before training is inconceivable. In this paper, we study the critical problem, domain generalization in object detection (DGOD), where detectors are trained with source domains and evaluated on unknown target domains. To thoroughly evaluate detectors under unknown distribution shifts, we formulate the DGOD problem and propose a comprehensive evaluation benchmark to fill the vacancy. Moreover, we propose a novel method named Region Aware Proposal reweighTing (RAPT) to eliminate dependence within RoI features. Extensive experiments demonstrate that current DG methods fail to address the DGOD problem and our method outperforms other state-of-the-art counterparts.

研究の動機と目的

  • 自律走行などの実世界の応用で一般的な未知の分布シフト下でのオブジェクト検出器の評価における重要なギャップを解消すること。
  • モデルが既知のソースドメインで学習され、完全に未知のターゲットドメインでテストされる「オブジェクト検出におけるドメイン一般化(DGOD)」問題を定式化すること。
  • クラシックなDG、密度シフト、文脈シフト、ランダムシフトの4つの異なるシフトタイプを含む包括的なクロスデータセット評価ベンチマークを構築すること。
  • 領域不変特徴と領域固有特徴(例:文脈、スタイル)の間の誤った相関を軽減する新規手法RAPTを提案すること。
  • 現在のドメイン一般化および適応手法が未知の分布シフトにおいて失敗することを示し、RAPTが最先端の一般化性能を達成することを実証すること。

提案手法

  • 大規模な検出データセットを密度、文脈、ランダム分割などの分布シフトに基づいて2群(学習用・評価用)に分割する新しい評価プロトコルを提案する。
  • RoI特徴とドメイン固有属性の間の統計的依存を最小化するように学習する提案領域レベルの重み付け機構であるRegion Aware Proposal reweighTing(RAPT)を導入する。
  • Faster R-CNN、RetinaNet、CrowdDetなどの既存の提案ベース検出器にRAPTをプラグインモジュールとして適用し、学習された提案重要度に基づいて損失を再重み付けする。
  • カテゴリ関連特徴とドメイン関連特徴の相関を低減することで、RoI特徴の不変性を促進するためのコントラスト学習目的関数を用いる。
  • クラスタリングに基づくデータグループ化を用いて、現実的な分布シフトを模擬し、多様で未知のテストドメインにおける一般化性能の評価を可能にする。
  • 密度シフト(例:Caltech 対 CrowdHuman)、文脈シフト(例:街中対オープンワールド)、およびデータセットのランダム分割の4つの異なるシフト設定で手法を検証する。

実験結果

リサーチクエスチョン

  • RQ1トレーニング時に観測されていない完全に未知の分布シフトでテストされた場合、現代のオブジェクト検出器はどの程度の性能を示すか?
  • RQ2既存のドメイン一般化および適応手法は、未知のドメインシフト下でのオブジェクト検出において、どのような主な失敗モードを示すか?
  • RQ3提案領域レベルの再重み付け機構は、オブジェクト検出における領域不変特徴と領域固有特徴の間の誤った相関を効果的に軽減できるか?
  • RQ4RAPTは、歩行者密度の変化、シーンの文脈、ランダムなデータセット分割といった多様な分布シフトに対して、どの程度一般化性能を向上させられるか?
  • RQ5RAPTは異なる検出器アーキテクチャに一般化可能であり、密なおよび疎な歩行者検出シナリオの両方で性能を向上させられるか?

主な発見

  • 現在のドメイン一般化および適応手法は、トレーニング時に利用されていない未知の分布シフトにおいて、オブジェクト検出で一般化に失敗することが判明した。
  • Faster R-CNNのような汎用的検出器は、CrowdDet や IterDet などの特化型歩行者検出器よりも、未知の密集または疎なシーンで優れた性能を示しており、特化型モデルが不変特徴を学習していないことが示唆された。
  • RAPTは、密度シフト、文脈シフト、ランダム分布シフトのすべての評価設定で最先端の性能を達成し、Faster R-CNN や RetinaNet、特化型検出器を一貫して上回った。
  • ECPデータセット(密集シーン)では、RAPTはFaster R-CNNに対して4.2% AP向上、CrowdDetに対しては3.1% AP向上を達成し、困難な密集状況でも有効性を示した。
  • 文脈シフト評価(例:WiderPedestrian などの非交通データセットで学習し、CityPersons でテスト)において、RAPTはすべての設定で最高のmAPを達成し、文脈分布シフトに対して高い耐性を示した。
  • 可視化結果から、RAPTはランダム分布シフト下でもより正確で誤検出が少ないバウンディングボックスを生成しており、ドメイン固有のパターンへの過学習が低減され、一般化性能が向上していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。