[論文レビュー] ScratchDet: Training Single-Shot Object Detectors from Scratch
この論文では、バックボーンおよび検出ヘッドの両方のネットワークにバッチ正則化を統合することで、ImageNetの事前学習に依存しない安定した学習と高い性能を実現する、スクラッチから訓練可能なワンショットオブジェクト検出器であるScratchDetを提案する。特徴マップの解像度を保持する新しいルート-ResNetバックボーンを導入することで、PASCAL VOC 2007(86.3%)、VOC 2012(86.3%)、MS COCO(マルチスケールテスト時39.1% AP)で最先端のmAPを達成し、いくつかの事前学習済み検出器を上回った。
Current state-of-the-art object objectors are fine-tuned from the off-the-shelf networks pretrained on large-scale classification dataset ImageNet, which incurs some additional problems: 1) The classification and detection have different degrees of sensitivity to translation, resulting in the learning objective bias; 2) The architecture is limited by the classification network, leading to the inconvenience of modification. To cope with these problems, training detectors from scratch is a feasible solution. However, the detectors trained from scratch generally perform worse than the pretrained ones, even suffer from the convergence issue in training. In this paper, we explore to train object detectors from scratch robustly. By analysing the previous work on optimization landscape, we find that one of the overlooked points in current trained-from-scratch detector is the BatchNorm. Resorting to the stable and predictable gradient brought by BatchNorm, detectors can be trained from scratch stably while keeping the favourable performance independent to the network architecture. Taking this advantage, we are able to explore various types of networks for object detection, without suffering from the poor convergence. By extensive experiments and analyses on downsampling factor, we propose the Root-ResNet backbone network, which makes full use of the information from original images. Our ScratchDet achieves the state-of-the-art accuracy on PASCAL VOC 2007, 2012 and MS COCO among all the train-from-scratch detectors and even performs better than several one-stage pretrained methods. Codes will be made publicly available at https://github.com/KimSoybean/ScratchDet.
研究の動機と目的
- オブジェクト検出におけるImageNet事前学習済みバックボーンへの依存を排除し、アーキテクチャ的制約と最適化バイアスを回避すること。
- 多様なネットワークアーキテクチャにおいて、ランダム初期化からの検出器の安定した学習を可能にすること。
- 事前学習なしで、事前学習済みモデルと同等またはそれ以上の検出性能を達成すること。
- ネットワークの初期特徴抽出段階を再設計することで、小サイズオブジェクトの検出性能を向上させること。
提案手法
- トレーニングのダイナミクスを安定化させ、最適化の滑らかさを向上させるために、バックボーンおよび検出ヘッドの両方のサブネットワークにバッチ正則化層を統合する。
- 元の画像からの情報伝達を強化し、高解像度の特徴マップを維持する新しいルートブロックを備えたルート-ResNetバックボーンを提案する。
- 特に初期畳み込み層において、ダウンサンプリング要因とサンプリングステップの選択が検出精度に与える影響を解明するため、広範なアブレーションスタディを実施する。
- ImageNet事前学習を一切使用せず、標準的なトレーニングプロトコルに従って、PASCAL VOCおよびMS COCOデータセット上でランダム初期化から検出器を訓練する。
- MS COCOでの性能をさらに向上させるためにマルチスケールテストを採用し、最先端の結果を達成する。
- MS COCOで学習し、PASCAL VOCでファインチューニングすることで、汎用性を検証し、優れた転移性を示す。
実験結果
リサーチクエスチョン
- RQ1事前学習なしで、事前学習済みモデルと同等またはそれ以上の性能を達成できるオブジェクト検出器をスクラッチから訓練できるか?
- RQ2オブジェクト検出において、ランダム初期化からの学習を安定化させる要因としてバッチ正則化が果たす役割は何か?
- RQ3初期層におけるダウンサンプリング戦略の選択が、特に小サイズオブジェクトの検出精度に与える影響は何か?
- RQ4事前学習なしで、空間情報を保持し、検出性能を向上させる新しいバックボーンアーキテクチャを設計できるか?
- RQ5MS COCOでスクラッチから学習することで、PASCAL VOCのような下流データセットでの性能が向上するか?
主な発見
- マルチスケールテストを用いた場合、PASCAL VOC 2007およびVOC 2012の両方で86.3%のmAPを達成し、スクラッチから学習する検出器として新たな最先端性能を樹立した。
- MS COCOでは、ScratchDet300がマルチスケールテストで39.1%のAPを達成し、同サイズの入力を持つ他のワンステージ検出器をすべて上回った。
- 前回のスクラッチから学習する最先端手法であるGRP-DSOD320と比較して、MS COCOでAPが2.7%向上した。
- MS COCOにおける小サイズオブジェクトのAPは13.0%に達し、SSD321を6.8%上回り、優れた小サイズオブジェクト検出能力を示した。
- バックボーンとヘッドの両方にバッチ正則化を統合することで、VGGNetやResNetなどの多様なアーキテクチャにおいて、事前学習なしで安定した学習が可能になった。
- MS COCOでスクラッチから学習し、PASCAL VOCでファインチューニングすることで、両データセットで最高のmAPスコアが得られ、モデルの強力な汎用性と転移性を確認した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。