Skip to main content
QUICK REVIEW

[論文レビュー] OMNIA Faster R-CNN: Detection in the wild through dataset merging and soft distillation

Alexandre Ramé, Emilien Garreau|arXiv (Cornell University)|Dec 6, 2018
Advanced Neural Network Applications参考文献 65被引用数 10
ひとこと要約

本論文では、自己訓練とソフト distillation を用いてカテゴリが非重複する複数のデータセットを統合することで、追加のアノテーションを必要とせずに頑健なオブジェクト検出器を訓練する方法、OMNIA Faster R-CNN を提案する。これはドメイン適応(Cityscapes で 44.9 mAP)において最先端の性能を達成し、COCO と Modanet を統合することでファッション検出の mAP を 45.5% から 57.4% まで向上させる。

ABSTRACT

Object detectors tend to perform poorly in new or open domains, and require exhaustive yet costly annotations from fully labeled datasets. We aim at benefiting from several datasets with different categories but without additional labelling, not only to increase the number of categories detected, but also to take advantage from transfer learning and to enhance domain independence. Our dataset merging procedure starts with training several initial Faster R-CNN on the different datasets while considering the complementary datasets' images for domain adaptation. Similarly to self-training methods, the predictions of these initial detectors mitigate the missing annotations on the complementary datasets. The final OMNIA Faster R-CNN is trained with all categories on the union of the datasets enriched by predictions. The joint training handles unsafe targets with a new classification loss called SoftSig in a softly supervised way. Experimental results show that in the case of fashion detection for images in the wild, merging Modanet with COCO increases the final performance from 45.5% to 57.4% in mAP. Applying our soft distillation to the task of detection with domain shift between GTA and Cityscapes enables to beat the state-of-the-art by 5.3 points. Our methodology could unlock object detection for real-world applications without immense datasets.

研究の動機と目的

  • カテゴリが重複しないが限られたアノテーションを伴うデータセットが存在するオープンワールドまたはオープンドメイン設定において、頑健なオブジェクト検出器を訓練する課題に対処すること。
  • 初期検出器の予測を弱い監督として活用することで、手動でのインスタンスアノテーションの高コストを克服し、データセット間で欠落しているアノテーションを補完すること。
  • モデルが予測したボクセルボックスを含む統合データセットを共同で学習することで、ドメインシフトが生じる状況においてもドメイン一般化と検出器の頑健性を向上させること。
  • 予測の不確実性を扱うための新しいソフト分類損失(SoftSig)を開発し、トレーニング中に高信頼度(安全)と低信頼度(危険)の検出を区別すること。
  • 包括的な再アノテーションや完全なドメイン特化データセットを必要とせずに、ファッション認識や自動運転などの実世界応用における検出器の実用的導入を可能にすること。

提案手法

  • COCO や Modanet などの各ソースデータセットで個別に初期 Faster R-CNN モデルを学習するが、ドメイン適応のために補完的データセットの画像も使用する。
  • 各初期検出器の予測結果を仮ラベルとして用い、元来存在しないカテゴリのアノテーションを補完的データセットに埋め込む。
  • 最終的な OMNIA Faster R-CNN を、すべてのデータセットの結合(真のアノテーションと予測アノテーションを含む)上で学習し、不確実性を扱うために新しい分類損失である SoftSig を使用する。
  • SoftSig 損失は、高信頼度の予測を信頼できるターゲットとし、低信頼度の予測を不確実なものとして扱い、信頼性の低い仮ラベルによるノイズを低減するソフトな監督を可能にする。
  • トレーニング中にソフト distillation を適用し、初期検出器から最終モデルへの知識移行を実現し、ドメインシフトに対する一般化性能と頑健性を向上させる。
  • 反復的自己訓練を適用:更新された予測結果を用いて統合データセット上で検出器を再学習し、追加のラベリングなしに段階的に性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1カテゴリが非重複する複数のデータセットを、追加の手動アノテーションなしに効果的に学習できるか?
  • RQ2モデルの予測を弱い監督として活用することで、データセット統合時の欠落アノテーションをどのように緩和できるか?
  • RQ3不確実性や低信頼度予測を扱うソフト分類損失(SoftSig)は、検出器性能にどの程度向上効果をもたらすか?
  • RQ4提案手法は、合成データから実世界データへの転送を含むドメイン適応タスクで最先端の性能を達成できるか?
  • RQ5補完的なカテゴリを持つデータセットを統合することで、検出器の一般化性能と背景理解が向上し、特にオープンセット検出の場面で有効か?

主な発見

  • COCO と Modanet を OMNIA Faster R-CNN で統合することで、OpenImages におけるファッションガーメント検出の mAP が 45.5% から 57.4% に向上し、顕著な性能向上を示した。
  • 本手法は SIM100K から Cityscapes へのドメイン適応ベンチマークで新たな最先端性能を達成し、車両検出で 44.9 mAP を記録。前回の SOTA よりも 5.3 ポイント高い。
  • SoftSig 損失はハード distillation やベースライン手法を上回り、Cityscapes で 44.9 mAP、KITTI で 65.4 mAP を達成。信頼性の高い性能向上を示した。
  • OMNIA SoftSig を用いた反復的自己訓練が最良の性能(42.2 mAP)を達成し、完全なアノテーションが利用可能なオラクル性能(59.6 mAP)に近づいた。
  • 本手法は新しいドメインにも良好に一般化する:KITTI では、OMNIA モデルが車両検出で 69.9 mAP を達成し、オラクルの 72.1 mAP に近く、強いドメイン不変性を示した。
  • 背景理解の向上により誤検出が減少した:補助カテゴリ(例:トラック)の検出が、主ターゲット(例:車)の性能向上に寄与した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。