Skip to main content
QUICK REVIEW

[論文レビュー] Solution for Large-Scale Hierarchical Object Detection Datasets with Incomplete Annotation and Data Imbalance

Yuan Gao, Xingyuan Bu|arXiv (Cornell University)|Oct 15, 2018
Advanced Image and Video Retrieval Techniques参考文献 16被引用数 16
ひとこと要約

本論文は、Open Images 2018 Challengeにおける大規模階層的オブジェクト検出に対して包括的なソリューションを提示し、アノテーションの著しい不完全性とデータのアンバランスに対処するため、クラスに応じたサンプリング(CAS)、階層的非最大抑制(HNMS)、SNIPER、モデルアンサンブルといった戦略を採用している。SENet154と特徴マップピラミッド、可変リージョンオブイントェンションアライメントを組み合わせた手法は、パブリックリーダーボードで62.2%のmAPを達成し2位となり、最良の単一モデルでは56.9%のmAPを記録した。

ABSTRACT

This report demonstrates our solution for the Open Images 2018 Challenge. Based on our detailed analysis on the Open Images Datasets (OID), it is found that there are four typical features: large-scale, hierarchical tag system, severe annotation incompleteness and data imbalance. Considering these characteristics, an amount of strategies are employed, including SNIPER, soft sampling, class-aware sampling (CAS), hierarchical non-maximum suppression (HNMS) and so on. In virtue of these effective strategies, and further using the powerful SENet154 armed with feature pyramid module and deformable ROIalign as the backbone, our best single model could achieve a mAP of 56.9%. After a further ensemble with 9 models, the final mAP is boosted to 62.2% in the public leaderboard (ranked the 2nd place) and 58.6% in the private leaderboard (ranked the 3rd place, slightly inferior to the 1st place by only 0.04 point).

研究の動機と目的

  • Open Imagesのような大規模階層的オブジェクト検出データセットにおける著しいアノテーションの不完全性と極端なデータアンバランスの課題に対処すること。
  • 階層的クラス構造内での長尾およびレアカテゴリにおける検出性能の向上。
  • 現実世界の不完全にアノテートされたデータセットに特化した効果的なトレーニング戦略の開発と検証。
  • 2段階検出器フレームワークを用いてOpen Images 2018 Challengeで最先端のパフォーマンスを達成すること。

提案手法

  • トレーニング中に未代表的なクラスからのハード例を優先するため、クラスに応じたサンプリング(CAS)を採用し、希少カテゴリの検出を向上させた。
  • 階層的信頼度スコアを活用して親子クラス関係の検出を向上させるために、階層的非最大抑制(HNMS)を適用した。
  • スケールに応じたトレーニングを実現するため、同程度のスケールのパッチをサンプリングするSNIPERを統合し、小・大インスタンスの特徴活用を改善した。
  • 特徴マップピラミッド(FPN)と可変リージョンオブイントェンションアライメントを組み合わせた強力なバックボーン(SENet154)を用いて、特徴表現と局所化精度を向上させた。
  • マルチスケールトレーニングとテスト(MST)およびミニバリデーションセットを用いたデータ拡張を実装し、汎化性能とトレーニング効率を向上させた。
  • バックボーン、可変レイヤー、コンponentsの異なる9つの多様な設定を組み合わせたモデルアンサンブルを実施し、最終的なパフォーマンスを向上させた。

実験結果

リサーチクエスチョン

  • RQ1大規模データセットにおける著しいアノテーションの不完全性に対処するため、オブジェクト検出モデルはどのように効果的にトレーニング可能か?
  • RQ2階層的検出タスクにおける極端なクラスアンバランスによって引き起こされる性能低下を緩和するにはどのような戦略が有効か?
  • RQ3階層的非最大抑制(HNMS)は、親クラスおよび子クラスの関係検出をどの程度向上できるか?
  • RQ4スケールに応じたサンプリング(SNIPER)とクラスに応じたサンプリング(CAS)を併用することで、希少および小サイズオブジェクトの検出はどの程度向上するか?
  • RQ5モデルアンサンブルとアーキテクチャの強化は、長尾検出における個々のモデルの限界を克服できるか?

主な発見

  • 最良の単一モデルは、SENet154とFPN、可変リージョンオブイントェンションアライメント、および全戦略の組み合わせを用いて56.9%のmAPを達成した。
  • クラスに応じたサンプリング(CAS)は、ベースラインから7.6ポイントのmAP向上をもたらし、希少カテゴリへの強い影響を示した。
  • 階層的NMS(HNMS)はさらに2ポイントの性能向上をもたらし、階層的クラス関係の検出を強化した。
  • 9つのモデルからなる最終アンサンブルは、パブリックリーダーボードで62.2%のmAPを達成し2位となり、プライベートリーダーボードでは58.6%を記録し、1位と0.04ポイントの差にとどまった。
  • オンラインハード例マイニング(OHEM)は、アノテートされていない真のインスタンスがハードネガティブ例として誤分類されたため、性能を低下させた。これは、アノテーションが不完全な環境でのリスクを浮き彫りにした。
  • 5,000枚の画像からなるミニバリデーションセットを用いたデータ拡張により、mAPが0.9ポイント向上し、トレーニングデータの拡張による効率的向上が実証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。