Skip to main content
QUICK REVIEW

[論文レビュー] Unsupervised Domain Adaptation for Multispectral Pedestrian Detection

Dayan Guan, Xing Luo|arXiv (Cornell University)|Apr 7, 2019
Video Surveillance and Tracking Methods参考文献 36被引用数 4
ひとこと要約

本稿では、マルチスペクトル歩行者検出のための教師なしドメイン適応フレームワークを提案する。このフレームワークは、手動アノテーションを一切用いずに、ターゲットドメイン上で疑似アノテーションを反復的に生成し、二重ストリーム検出器を更新する。対応する可視光と赤外画像間の類似性および補完性を活用することで、教師ありモデルと同等の検出性能を達成し、非適応ベースライン比でAPを31.37%向上させ、最先端の教師なし手法比でも6.67%向上した。

ABSTRACT

Multimodal information (e.g., visible and thermal) can generate robust pedestrian detections to facilitate around-the-clock computer vision applications, such as autonomous driving and video surveillance. However, it still remains a crucial challenge to train a reliable detector working well in different multispectral pedestrian datasets without manual annotations. In this paper, we propose a novel unsupervised domain adaptation framework for multispectral pedestrian detection, by iteratively generating pseudo annotations and updating the parameters of our designed multispectral pedestrian detector on target domain. Pseudo annotations are generated using the detector trained on source domain, and then updated by fixing the parameters of detector and minimizing the cross entropy loss without back-propagation. Training labels are generated using the pseudo annotations by considering the characteristics of similarity and complementarity between well-aligned visible and infrared image pairs. The parameters of detector are updated using the generated labels by minimizing our defined multi-detection loss function with back-propagation. The optimal parameters of detector can be obtained after iteratively updating the pseudo annotations and parameters. Experimental results show that our proposed unsupervised multimodal domain adaptation method achieves significantly higher detection performance than the approach without domain adaptation, and is competitive with the supervised multispectral pedestrian detectors.

研究の動機と目的

  • KAIST や CVC-14 のようなマルチスペクトル歩行者検出データセット間におけるドメインシフトの課題に対処すること。特に、あるドメインで訓練された検出器が別のドメインで性能を発揮しない問題に焦点を当てる。
  • ターゲットドメインにおける高コストな手動アノテーションの必要性を排除し、疑似ラベルを用いた教師なし適応により、ドメイン適応を可能にすること。
  • 可視光と赤外モダリティの補完的特徴を活用することで、視点、天候、カメラ設定の変化に対しても検出のロバスト性を向上させること。
  • 反復的最適化を伴うにもかかわらず、教師あり学習と比較して最小限の計算コスト増加で済むトレーニングフレームワークを構築すること。

提案手法

  • 事前学習済みのソースドメイン用検出器(例:KAIST)を用いて疑似アノテーションを生成し、その後、検出器の重みを固定した状態で、バックプロパゲーションなしに交差エントロピー損失を最小化することで、疑似アノテーションを精錬する。
  • 空間的に整合する可視光および赤外ストリームからの疑似アノテーションを統合することで、トレーニングラベルを生成し、空間的整合性、類似性、補完的特徴を活用する。
  • 二重ストリーム検出器の共同最適化を可能にするために、精錬済みの疑似ラベル上で多検出損失関数を定義し、バックプロパゲーションによる特徴学習を実現する。
  • 疑似アノテーションの精錬と検出器パラメータの更新を反復的に交互に繰り返すことで、ターゲットドメインにおける汎化性能を向上させる。
  • 疑似ラベル生成における空間的一致性を確保するため、良好にアライメントされた可視光・赤外画像ペアを活用し、検出の信頼性を向上させる。
  • 勾配計算を必要としないため、疑似ラベル最適化に追加の計算コストがほとんどかからないため、スケーラブルで効率的なアプローチとして設計されている。

実験結果

リサーチクエスチョン

  • RQ1教師なしドメイン適応が、手動アノテーションなしでターゲットドメインにおけるマルチスペクトル歩行者検出性能を顕著に向上させることができるか?
  • RQ2本手法は、さまざまな照明条件や環境条件下で、教師ありベースラインと比較してどの程度の検出精度を達成するか?
  • RQ3ソースドメイン用検出器から生成された疑似アノテーションが、ドメインシフトを示すターゲットドメインにどの程度一般化可能か?
  • RQ4反復的最適化を通じて可視光と赤外特徴を統合することで、検出のロバスト性が向上するか?
  • RQ5完全に教師ありアプローチに近い性能を達成しつつ、トレーニング効率を維持できるか?

主な発見

  • 提案手法である教師なしマルチモーダルドメイン適応(UMDA)は、CVC-14 データセットでピクセル単位の平均適合率(AP)0.8023を達成し、ACF+T+THOGベースライン比で8.84%高いが、教師ありSMDAモデル比では6.67%低い結果となった。
  • UMDAは、非適応ベースライン(WMDA)と比較してAPで31.37%の向上を達成し、ドメイン適応の有効性を実証した。
  • 昼間(0.7688 AP)および夜間(0.8503 AP)の両条件で競争力ある結果を達成し、照明変動に対するロバストネスを示した。
  • 定性的な結果から、UMDAは人間の特徴がいずれのモダリティでも明確に識別可能な場合にはSMDAと同等の性能を示したが、ごみや背景が複雑な場面やコントラストが低い状況では困難を示した。
  • 疑似ラベル最適化にバックプロパゲーションが不要なため、追加コストがほとんどないため、本手法のトレーニング時間は教師あり学習とほぼ同一であった。
  • SMDAにおける二重ストリーム検出器監視モジュールが性能向上に寄与しており、マルチスペクトル検出におけるモダリティ固有の特徴学習の価値を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。