Skip to main content
QUICK REVIEW

[論文レビュー] End-to-end training of object class detectors for mean average precision

Paul Henderson, Vittorio Ferrari|arXiv (Cornell University)|Jul 12, 2016
Domain Adaptation and Few-Shot Learning参考文献 24被引用数 11
ひとこと要約

本稿では、mAP(平均平均精度)を損失関数として用い、トレーニング中に非最大抑制(NMS)を含めた、畳み込みニューラルネットワーク(CNN)ベースのオブジェクト検出器のエンド・ツー・エンド学習を提案する。mAPにNMSを含めたバックプロパゲーションを可能にするために、区分的定数関数に対する新しい擬似勾配推定器を導入し、標準的なFast R-CNNと同等の性能を達成するとともに、トレーニングと推論の両方で同一の目的関数を確保する。

ABSTRACT

We present a method for training CNN-based object class detectors directly using mean average precision (mAP) as the training loss, in a truly end-to-end fashion that includes non-maximum suppression (NMS) at training time. This contrasts with the traditional approach of training a CNN for a window classification loss, then applying NMS only at test time, when mAP is used as the evaluation metric in place of classification accuracy. However, mAP following NMS forms a piecewise-constant structured loss over thousands of windows, with gradients that do not convey useful information for gradient descent. Hence, we define new, general gradient-like quantities for piecewise constant functions, which have wide applicability. We describe how to calculate these efficiently for mAP following NMS, enabling to train a detector based on Fast R-CNN directly for mAP. This model achieves equivalent performance to the standard Fast R-CNN on the PASCAL VOC 2007 and 2012 datasets, while being conceptually more appealing as the very same model and loss are used at both training and test time.

研究の動機と目的

  • トレーニング時にウィンドウ分類精度を最適化するのに対し、テスト時にmAPで評価するというギャップを解消すること。
  • NMSとmAPをトレーニングの目的関数として組み込むことで、オブジェクト検出器の真のエンド・ツー・エンド学習を可能にすること。
  • mAPが非微分可能で区分的定数であるという課題を克服し、NMS後のmAPの勾配に類似する新たな量を定義すること。
  • 標準的なディープラーニングフレームワークと互換性があり、高価なmax-Oracle計算を必要としない手法を開発すること。

提案手法

  • 区分的定数関数のための2つの新しい擬似勾配推定器—MEE(期待編集の平均)とSDE(スコア差分推定器)—を提案し、NMS後のmAPの勾配を近似する。
  • NMS後の検出結果に基づきmAPを計算する微分可能損失レイヤーを導入し、検出パイプライン全体にわたるバックプロパゲーションを可能にする。
  • Fast R-CNNフレームワーク内に本手法を適用し、mAPを損失関数として用いて、確率的勾配降下法で全検出器をエンド・ツー・エンドに学習する。
  • NMSをトレーニング中に適用することで、モデルが最終評価指標(非局所的抑制効果を含む)を最適化するように学習する。
  • mAPの勾配が疎で高分散であるため、学習の安定化のためスコア正則化と勾配クリッピングを採用する。
  • Caffeなどの既存のディープラーニングフレームワークに即座に統合可能であり、最適化アルゴリズムの変更を一切不要とする設計である。

実験結果

リサーチクエスチョン

  • RQ1NMSをトレーニング段階に含め、mAPを直接最適化できるか、テスト時でのみNMSを適用するのではなく?
  • RQ2標準的なバックプロパゲーションが失敗する中で、NMS後の区分的定数mAP損失の勾配をどのように近似できるか?
  • RQ3NMSを含めたmAPに対するエンド・ツー・エンド学習は、ウィンドウ分類精度を最適化する従来の学習と同等の性能を達成できるか?
  • RQ4提案された擬似勾配推定器は、情報検索で用いられる他の区分的定数損失に対しても一般化可能か?
  • RQ5実際の応用において本手法は安定的かつスケーラブルか?また、高価なmax-Oracle計算を回避できるか?

主な発見

  • mAPとNMSを用いたトレーニングにおいて、PASCAL VOC 2007および2012の両データセットで、標準的なFast R-CNNと同等のmAP性能を達成した。
  • すべての実験においてMEE推定器がSDEをわずかに上回り、特にスコアの距離変動に対して高いロバスト性を示した。
  • VGG16モデルがAlexNetを上回る性能を示し、mAPで学習する際の深層アーキテクチャの利点を裏付けた。
  • アブレーションスタディの結果、前景サンプリング比、バッチサイズ、スコア正則化、勾配クリッピングといった重要なトレーニングの修正が、学習の安定性に不可欠であることが示された。
  • 勾配クリッピングやスコア正則化がなければ、勾配が数値的に不安定になり、スコアの爆発を引き起こして学習が失敗した。
  • クラス固有のモデルやmax-Oracle計算を必要としない点で、先行研究(Song et al. [19])に比べて学習の安定性と汎用性に優れ、性能を上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。