[論文レビュー] A Survey of Modern Deep Learning based Object Detection Models
本サーベイは、二段階およびワンステージ検出器、バックボーンアーキテクチャ、エッジデプロイ用の軽量モデルをカバーする、現代の深層学習ベースの物体検出モデルの包括的な分析を提供する。PASCAL VOCおよびMS COCOベンチマーク上で最先端のモデルを評価し、精度(AP)と推論速度(FPS)のトレードオフを強調している。DetectoRSは、ResNeXt-101を用いてCOCOで53.3%のAPを達成した。
Object Detection is the task of classification and localization of objects in an image or video. It has gained prominence in recent years due to its widespread applications. This article surveys recent developments in deep learning based object detectors. Concise overview of benchmark datasets and evaluation metrics used in detection is also provided along with some of the prominent backbone architectures used in recognition tasks. It also covers contemporary lightweight classification models used on edge devices. Lastly, we compare the performances of these architectures on multiple metrics.
研究の動機と目的
- 近年の深層学習ベースの物体検出モデルにおける進歩を体系的レビューすること、両段階およびワンステージ検出器を含む。
- 現代の物体検出器に用いられる代表的なバックボーンアーキテクチャ(ResNet、ResNeXt、Swin Transformerなど)の分析と比較を行うこと。
- エッジおよびモバイルデバイス向けに最適化された軽量ニューラルネットワークモデルを評価し、効率性と精度のトレードオフに焦点を当てる。
- 平均平均精度(AP)、推論速度(FPS)、計算複雑度などの複数の指標に基づいて物体検出器を比較分析すること。
- 特に効率性、モデル圧縮、ハードウェアに配慮した設計の分野における現在のトレンドと今後の方向性を特定すること。
提案手法
- 本論文は、物体検出モデルを二段階(例:Faster R-CNN、Mask R-CNN)およびワンステージ(例:YOLO、SSD、RetinaNet)検出器に分類する構造的サーベイを実施する。
- 特徴抽出タスクにおける性能に基づき、ResNet、ResNeXt、EfficientNet、Swin Transformersなどのバックボーンネットワークを評価する。
- MobileNet、ShuffleNet、SqueezeNet、OFAなどの軽量モデルを、トップ1精度、遅延、パラメータ数、FLOPsなどの指標を用いて分析する。
- 標準ベンチマーク(PASCAL VOC 2012およびMS COCO)上でモデルを比較し、標準評価指標(AP(IoU ≥ 0.5)およびCOCO用のAP[0.5:0.95])を用いる。
- 元論文で報告された結果をもとに、精度(AP)、推論速度(FPS)、モデル複雑度(FLOPs)を焦点として比較分析を実施する。
- Once-for-All(OFA)手法を、再訓練を伴わず、深さ、幅、カーネルサイズが異なるサブネットワークを効率的に蒸留できる新しいアーキテクチャ設計の手法として検討する。

実験結果
リサーチクエスチョン
- RQ1標準ベンチマーク上で、現代の二段階およびワンステージ物体検出モデルは、精度と推論速度の観点からどのように比較されるか?
- RQ2物体検出において、精度と計算効率のトレードオフを最もよく満たすバックボーンアーキテクチャはどれか?
- RQ3MobileNet、ShuffleNet、OFAなどの軽量モデルは、エッジデプロイの観点から、精度、遅延、FLOPsの観点でどのように性能を発揮するか?
- RQ4PASCAL VOCおよびMS COCOデータセットで学習されたモデルには、特にIoU閾値とAP指標の観点でどのような主な性能差があるか?
- RQ5Once-for-All(OFA)フレームワークは、再訓練を伴わず、どのように効率的なモデル圧縮とハードウェアに配慮したアーキテクチャ探索を可能にするか?
主な発見
- DetectoRSは、ResNeXt-101と1333の入力サイズを用いて、MS COCOで53.3%のAPを達成し、当時、二段階検出器におけるSOTAを更新した。
- YOLOv4は、31 FPSの推論速度でMS COCOで43.0% APおよび64.9% APを達成し、優れたリアルタイム性能を示した。
- EfficientDet-D2は、41.7 FLOPsでCOCOで43.0% APおよび62.3% APを達成し、高い効率性と精度のバランスを実現した。
- OFAは、58msの遅延、595 MFLOPsでImageNet Top-1精度80.0%を達成し、第4回Low Power Computer Visionチャレンジで優勝した。
- MobileNetV3やOFAなどの軽量モデルは、600 MFLOPs未満で75%以上のTop-1精度を達成し、モバイルおよびエッジデバイスに適した性能を示した。
- CenterNetは、7.8 FPSでCOCOで42.1% APおよび61.1% APを達成し、キーポイントベース検出における強力な性能を示した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。