Skip to main content
QUICK REVIEW

[論文レビュー] Cross-dataset Training for Class Increasing Object Detection

Yongqiang Yao, Yan Wang|arXiv (Cornell University)|Jan 14, 2020
Advanced Neural Network Applications参考文献 31被引用数 16
ひとこと要約

本論文は、COCO、VOC、WIDER Face、WIDER Pedestrianなどの独立にラベル付けされた複数のデータセットから得たクラスを、顕著な精度の低下を伴わずに一度のオブジェクト検出器で共同で検出できる一般化されたクロスデータセット学習フレームワークを提案する。意味的に同一のラベルを統合し、データセットの分割を保持するとともに、矛盾する陽性/陰性サンプル間の回避関係を強制することで、すべてのデータセットで最先端の性能を同時に達成し、再ラベル付けを最小限に抑えた継続的学習を可能にする。

ABSTRACT

We present a conceptually simple, flexible and general framework for cross-dataset training in object detection. Given two or more already labeled datasets that target for different object classes, cross-dataset training aims to detect the union of the different classes, so that we do not have to label all the classes for all the datasets. By cross-dataset training, existing datasets can be utilized to detect the merged object classes with a single model. Further more, in industrial applications, the object classes usually increase on demand. So when adding new classes, it is quite time-consuming if we label the new classes on all the existing datasets. While using cross-dataset training, we only need to label the new classes on the new dataset. We experiment on PASCAL VOC, COCO, WIDER FACE and WIDER Pedestrian with both solo and cross-dataset settings. Results show that our cross-dataset pipeline can achieve similar impressive performance simultaneously on these datasets compared with training independently.

研究の動機と目的

  • 産業的および研究的環境において、新しいオブジェクトクラスが追加される際の既存データセットの再ラベル付けにかかる高コストを解消すること。
  • 異なるクラスラベルを持つ複数のデータセットからのオブジェクトクラスを、1つの検出器が同時に認識できるようにすること。
  • 相互に矛盾する陽性/陰性サンプルを含むデータセットを統合する際に性能劣化を回避する一般化可能で柔軟なトレーニングパイプラインを開発すること。
  • 再ラベル付けを伴わず、新しいクラスが段階的に追加される継続的学習のシナリオをサポートすること。

提案手法

  • 意味的に同一のクラス(例:'person' と 'pedestrian')を複数のデータセット間で統合することで、曖昧性を低減し、学習の安定性を向上させる。
  • 元の画像分割とデータセット境界を保持したまま、ラベルを連結することでハイブリッドデータセットを構築する。
  • あるデータセットの陽性サンプルと別のデータセットの陰性サンプルの間に回避関係を定義する(例:WIDER Faceの'face-negative' と COCOの'person-positive' の間)。これにより、混同を防ぐ。
  • バックプロパゲーション中にこの回避関係を強制するように変更された分類損失を用いて検出器をトレーニングする。
  • 一般化を評価するために、ResNet-50 や MobileNetV2 をバックボーンとして使用する標準的なオブジェクト検出フレームワーク(例:RetinaNet)を用いる。
  • すべてのデータセットにわたって一貫したアノテーションスケールとアスペクト比を適用し、公平な比較と安定した学習を保証する。

実験結果

リサーチクエスチョン

  • RQ1複数の独立ラベル付け済みデータセットからのオブジェクトクラスの集合を、顕著な性能低下を伴わずに1つのオブジェクト検出器で学習可能か?
  • RQ2意味的に類似したクラス(例:person/pedestrian)のラベル統合が、クロスデータセット検出性能に与える影響は何か?
  • RQ3矛盾する陽性/陰性サンプル(例:face-negative と person-positive)がクロスデータセット学習に与える影響は何か? また、それらをどのように緩和できるか?
  • RQ4提案手法は、異なるバックボーンやスケール分布が異なるデータセットドメインに対しても一般化可能か?
  • RQ5クロスデータセット学習は、新しいクラスが段階的に追加される実世界の応用において、継続的学習を可能にするか?

主な発見

  • ラベル統合を伴うクロスデータセット学習では、COCOとVOCを同時にトレーニングした場合、VOCで87.5 mAP、COCOで35.4 mAPを達成し、個別にトレーニングしたベースラインと比較して、顕著な性能低下を示さないか、わずかに下回る程度にとどまる。
  • WIDER Faceでは48.32% AP、WIDER Pedestrianでは43.86% APを維持しており、単一データセットのベースラインと比較して顕著な精度損失がないことが示された。
  • 意味的に類似したクラス(例:person と pedestrian)の統合により、約0.5 APの性能向上が確認され、分類の曖昧性が低減していることが示された。
  • フレームワークはバックボーンに依存せず、ResNet-50 と MobileNetV2 の両方で類似した性能が得られ、モデル容量に依存しないことが実証された。
  • アノテーションスケールの一貫性が性能を維持しており、公平な実験設定下でも本手法が有効に機能することが示された。
  • 方向性をクラスとして扱うことで、360度の顔検出が可能になった。これは、標準的な検出を超えた新規応用分野への潜在的応用可能性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。