Skip to main content
QUICK REVIEW

[論文レビュー] Domain Adaptive YOLO for One-Stage Cross-Domain Detection

Shizhao Zhang, Hongya Tuo|arXiv (Cornell University)|Jun 26, 2021
Domain Adaptation and Few-Shot Learning参考文献 32被引用数 15
ひとこと要約

本稿では、ドメインシフトを低減するために画像レベルおよびインスタンスレベルの特徴一致を統合する、ワンステージオブジェクト検出器向けの新規ドメイン適応フレームワーク、Domain Adaptive YOLO (DA-YOLO) を提案する。回帰的画像一致(RIA)、マルチスケールインスタンス一致(MSIA)、マルチレベルコンセンサス正則化(MLCR)を導入することで、DA-YOLO はクロスドメイン検出ベンチマークで最先端の性能を達成し、一部の設定では Faster R-CNN をベースとする手法よりも最大17.6% の mAP 向上を達成した。

ABSTRACT

Domain shift is a major challenge for object detectors to generalize well to real world applications. Emerging techniques of domain adaptation for two-stage detectors help to tackle this problem. However, two-stage detectors are not the first choice for industrial applications due to its long time consumption. In this paper, a novel Domain Adaptive YOLO (DA-YOLO) is proposed to improve cross-domain performance for one-stage detectors. Image level features alignment is used to strictly match for local features like texture, and loosely match for global features like illumination. Multi-scale instance level features alignment is presented to reduce instance domain shift effectively , such as variations in object appearance and viewpoint. A consensus regularization to these domain classifiers is employed to help the network generate domain-invariant detections. We evaluate our proposed method on popular datasets like Cityscapes, KITTI, SIM10K and etc.. The results demonstrate significant improvement when tested under different cross-domain scenarios.

研究の動機と目的

  • 照明、視点、画像品質の分布シフトにより、ドメイン間で展開された際の性能低下を引き起こすワンステージオブジェクト検出器におけるドメインシフトを解消すること。
  • Faster R-CNN のような二段階検出器を主眼として設計された従来のドメイン適応手法の限界を克服し、リアルタイム産業用途に不適切なほど遅い二段階検出器に依存しないこと。
  • 領域提案を必要とせず、YOLov3 に適した統合的ドメイン適応フレームワークを構築し、効果的な画像レベルおよびインスタンスレベルの特徴一致を可能にすること。
  • 自動運転のような実世界のシナリオにおけるドメイン間一般化性能を向上させること。ここでは、テストデータが天候、カメラアングル、画像の明瞭さにおいてトレーニングデータと異なることが一般的である。

提案手法

  • YOLOv3 の異なる特徴マップ層に、重みを徐々に減らす3つのドメイン分類器を用いる回帰的画像一致(RIA)を提案。これにより、局所的特徴(例:テクスチャ)に対してはきめ細やかな一致を、グローバル特徴(例:照明)に対しては緩い一致を実現する。
  • YOLOv3 の3つのスケール予測に、3つのインスタンスレベルドメイン分類器を適用するマルチスケールインスタンス一致(MSIA)を導入。これにより、異なる受容野における特徴を一致させ、インスタンスレベルのドメインシフトを低減する。
  • 画像レベルおよびインスタンスレベルのドメイン分類器間の一貫性を強制するマルチレベルコンセンサス正則化(MLCR)を実装。これにより、すべてのレベルでドメイン不変特徴を学習するようネットワークを促進する。
  • 勾配逆転層(GRL)を用いた adversarial 学習により、特徴抽出器とドメイン分類器を同時に最適化。これにより、ターゲットドメインのアノテーションが不要な状態でドメイン不変特徴を生成可能となる。
  • 検出損失、画像およびインスタンスレベルのドメイン分類損失、コンセンサス正則化損失を組み合わせた総合損失関数を用いて、エンドツーエンドでモデルを訓練する。
  • 複数のバックボーン層からの特徴マップを活用し、マルチスケールの適応を可能に。ドメイン分類器は YOLOv3 特徴抽出器の異なる段階に適用される。

実験結果

リサーチクエスチョン

  • RQ1Faster R-CNN のような二段階検出器向けに設計されたドメイン適応技術が、YOLOv3 のようなワンステージ検出器にも効果的に適用可能かどうか。
  • RQ2領域提案ネットワークを必要としないワンステージ検出器において、画像レベルおよびインスタンスレベルのドメイン一致をどのように同時に最適化できるか。
  • RQ3画像レベルドメイン分類器の重み戦略が、局所的特徴とグローバル特徴の一致に与える影響は何か。
  • RQ4画像レベルとインスタンスレベルのドメイン分類器間のコンセンサス正則化が、ワンステージ検出器におけるドメイン不変特徴学習にどのように寄与するか。
  • RQ5提案手法は、二段階検出器に基づく既存の SOTA 手法を上回るクロスドメイン検出性能を達成できるか。

主な発見

  • KITTI から Cityscapes へのドメイン移行において、DA-YOLO はベースラインの YOLOv3 よりも mAP で 17.6% 向上し、既存の Faster R-CNN をベースとするドメイン適応手法を大きく上回った。
  • Cityscapes から Foggy Cityscapes へのベンチマークでは、DA-YOLO は 54.0% の mAP を達成し、以前の SOTA 手法(51.8%)を 2.2 パーセンテージポイント上回り、オラクル性能(57.8%)に近づいた。
  • アブレーションスタディの結果、RIA、MSIA、MLCR の各モジュールが性能向上に段階的に寄与しており、特に Cityscapes から Foggy Cityscapes への設定で MLCR が 1.2% の mAP 向上をもたらした。
  • 重みが等しい画像一致よりも、重みを徐々に減らす RIA モジュールが mAP を 1.5% 向上させた。これは、局所的特徴の一致を優先する戦略の有効性を示している。
  • t-SNE 視覚化により、DA-YOLO がソースドメインとターゲットドメインのグローバル特徴を、ソースオンリーベースラインよりもよりよく一致させていることが確認され、ドメイン一致の成功が裏付けられた。
  • 定性的な結果では、悪天候条件下でベースラインモデルが見逃した車両を DA-YOLO が正しく検出しており、実世界のクロスドメインシナリオにおけるロバスト性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。