Skip to main content
QUICK REVIEW

[論文レビュー] Cheaper Pre-training Lunch: An Efficient Paradigm for Object Detection

Dongzhan Zhou, Xinchi Zhou|arXiv (Cornell University)|Apr 25, 2020
Advanced Neural Network Applications参考文献 46被引用数 4
ひとこと要約

本論文は、オブジェクト検出のための新しいで効率的な事前学習パラダイム「Montage pre-training」を提案する。この手法は、外部データ(例:ImageNet)を一切使用せず、検出タスク用のデータセットのみを用いることで、計算コストを4倍削減する。情報量の多いサンプルをマントゥー形式で構成し、ERF適応型の高密度分類を適用することで、ImageNet事前学習と同等またはそれ以上の検出性能を達成する。精度を損なわず、学習効率を著しく向上させる。

ABSTRACT

In this paper, we propose a general and efficient pre-training paradigm, Montage pre-training, for object detection. Montage pre-training needs only the target detection dataset while taking only 1/4 computational resources compared to the widely adopted ImageNet pre-training.To build such an efficient paradigm, we reduce the potential redundancy by carefully extracting useful samples from the original images, assembling samples in a Montage manner as input, and using an ERF-adaptive dense classification strategy for model pre-training. These designs include not only a new input pattern to improve the spatial utilization but also a novel learning objective to expand the effective receptive field of the pretrained model. The efficiency and effectiveness of Montage pre-training are validated by extensive experiments on the MS-COCO dataset, where the results indicate that the models using Montage pre-training are able to achieve on-par or even better detection performances compared with the ImageNet pre-training.

研究の動機と目的

  • オブジェクト検出用の事前学習において、ImageNetのような大規模外部分類データセットへの依存を排除すること。
  • 検出性能を維持または向上させながら、事前学習における計算コストを削減すること。
  • 背景の冗長性を低減し、情報量の多いサンプルに注目することで、空間的および特徴的利用効率を向上させること。
  • さまざまな検出フレームワークやバックボーンに適用可能な汎用的で効率的かつデータに依存しない事前学習パラダイムの開発

提案手法

  • 検出データセットの画像から陽性および陰性サンプルを抽出し、背景の冗長性を低減する。
  • アスペクト比に配慮した配置戦略を用いて、空間的利用効率を最大化するようにサンプルをマントゥー画像に組み立てる。
  • リサイズおよびクロップ戦略を適用し、データオーグメンテーション(ランダムフリップ、スケールジッタリング)を組み合わせて、入力サイズを標準化する。
  • ERF適応型の高密度分類を採用し、有効受容 field(ERF)に基づいてソフトラベルを割り当てることで、特徴学習を強化する。
  • グローバルおよびブロック単位の分類戦略を採用し、ERF適応型手法が両者を上回ることを確認した。
  • ERF重み付きラベル割り当てを用いて、標準的な交差エントロピー損失でマントゥー画像上でバックボーンを学習する。

実験結果

リサーチクエスチョン

  • RQ1ImageNetのような外部データセットに依存せずに、オブジェクト検出のための効率的な事前学習が可能か?
  • RQ2従来の事前学習における冗長な背景ピixeLをどのように低減することで、計算効率を向上させられるか?
  • RQ3検出データのみに依存する事前学習戦略が、ImageNet事前学習と同等の性能を達成できるか?
  • RQ4空間的レイアウトとラベル割り当て戦略が、事前学習の効果に与える影響は何か?
  • RQ5グローバルまたはブロック単位の分類と比較して、ERF適応型の高密度分類は特徴表現を改善するか?

主な発見

  • ResNet-50を用いたCOCO val2017で36.3 APを達成し、同一の学習設定下でImageNet事前学習(34.3 AP)を上回る性能を示した。
  • ERF適応型の高密度分類戦略は38.9 AP75を達成し、ブロック単位(37.6)およびグローバル(36.3)分類を著しく上回った。
  • 検出データセットのみを用いながら、ImageNet-1k事前学習と比較して4倍の計算コスト削減を達成した。
  • スケール調整のためのパッド&クロップ法が最良の性能(35.2 AP)を示し、ワープ法(34.6)やリサイズ法(34.7)を上回った。
  • 本手法は汎用的であり、複数の検出フレームワークおよびバックボーンで一貫した性能向上を示した。
  • Montage事前学習により、外部データや学習コストの増加なしに、高速な収束と競争力のある精度が実現可能となった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。