Skip to main content
QUICK REVIEW

[論文レビュー] Rethinking Drone-Based Search and Rescue with Aerial Person Detection

Pasi Pyrrö, Hassan Naseri|arXiv (Cornell University)|Nov 17, 2021
Advanced Neural Network Applications参考文献 41被引用数 4
ひとこと要約

本稿では、ドローンを用いた捜索救助(SAR)ミッションにおける空中からの人物検出を自動化する深層学習モデル、Aerial Inspection RetinaNet(AIR)を提案する。新しい後処理手法であるMerging of Overlapping Bounding boxes(MOB)と、SARに特化した新しい評価スキームを統合することで、HERIDALベンチマークにおいて、精度が94.9%(21パcentポイントの上昇)、再現率が92.9%を達成し、人間の検査者や最先端手法を著しく上回る性能を発揮した。

ABSTRACT

The visual inspection of aerial drone footage is an integral part of land search and rescue (SAR) operations today. Since this inspection is a slow, tedious and error-prone job for humans, we propose a novel deep learning algorithm to automate this aerial person detection (APD) task. We experiment with model architecture selection, online data augmentation, transfer learning, image tiling and several other techniques to improve the test performance of our method. We present the novel Aerial Inspection RetinaNet (AIR) algorithm as the combination of these contributions. The AIR detector demonstrates state-of-the-art performance on a commonly used SAR test data set in terms of both precision (~21 percentage point increase) and speed. In addition, we provide a new formal definition for the APD problem in SAR missions. That is, we propose a novel evaluation scheme that ranks detectors in terms of real-world SAR localization requirements. Finally, we propose a novel postprocessing method for robust, approximate object localization: the merging of overlapping bounding boxes (MOB) algorithm. This final processing stage used in the AIR detector significantly improves its performance and usability in the face of real-world aerial SAR missions.

研究の動機と目的

  • 陸上における捜索救助(SAR)作業における、遅く、誤りの多い手作業による空中ドローン映像の点検を自動化すること。
  • 高解像度の空中画像において、小さな、コントラストが低い人物を、密集したオブジェクト群が存在する状況で検出する課題に対処すること。
  • 実運用におけるSARの位置特定要件をよりよく反映するよう、空中人物検出の評価指標を再定義し、正確な位置特定よりも検出の優先度を高めること。
  • SAR画像に一般的に見られる密集した人物グループの状況において、検出の信頼性を向上させる堅牢な後処理手法を開発すること。
  • 実時間での展開が可能であることを前提に、精度と速度の両面で最先端の性能を達成すること。

提案手法

  • AIR検出器は、空中画像における前景・背景クラスの不均衡を効果的に処理するように最適化された、ワンステージオブジェクト検出器であるRetinaNetに基づいている。
  • マルチスケール特徴抽出を実現するため、ResNeXt-101バックボーンと特徴マップピラミッド(FPN)を採用し、小規模なオブジェクトの検出性能を向上させた。
  • オンラインデータオーグメンテーション、トランスファー学習、信頼度スコアのしきい値キャリブレーションを適用することで、汎化性能とテスト性能を向上させた。
  • Merging of Overlapping Bounding boxes(MOB)アルゴリズムは、検出出力に対してクラスタリングと重複ボックスの統合を実行し、密集したグループにおける誤検出を低減する。
  • 実運用におけるSAR要件を反映するため、位置特定の正確性よりも検出の優先度を高めた、新しいSAR-APD評価スキームを導入した。IoUのしきい値を緩和することで、実世界のSAR要件を反映した評価を可能にした。
  • VOC2012とSAR-APDの両方の評価プロトコルを用いて、HERIDALベンチマーク上で本手法の妥当性を検証し、異なる基準下での性能を比較した。

実験結果

リサーチクエスチョン

  • RQ1深層学習をどのように活用することで、ドローンを用いたSARミッションにおける空中人物検出を自動化し、手作業による画像点検への依存を減らせるか?
  • RQ2高解像度の空中画像において、小さな、コントラストが低い人物を効果的に検出するための、最良のモデルアーキテクチャとトレーニング戦略は何か?
  • RQ3提案されたMOB後処理手法は、標準的なNMSと比較して、密集した人物グループの状況における検出の頑健性をどの程度向上させるか?
  • RQ4従来のVOC2012のような指標と比較して、新しいSAR-APD評価スキームは、実運用におけるニーズをどの程度よく反映しているか?
  • RQ5AIR検出器は、HERIDALベンチマークにおいて、人間の検査者や既存の最先端モデルを、精度、再現率、推論速度の両面で上回ることができるか?

主な発見

  • 提案されたSAR-APD評価スキームの下で、AIR検出器はHERIDALテストセットにおいて94.9%の精度と92.9%の再現率を達成し、前例の手法と比較して精度が21パーセントポイント上昇した。
  • MOB後処理手法により、過度な信頼度しきい値の設定の必要が軽減され、精度を損なわずに再現率を高めることが可能になった。
  • SAR-APD評価スキームの下で、AIRは平均精度(AP)91.7%を達成し、10倍速く、エンドツーエンドでトレーニング可能な強力なベースライン(Multimodel CNN)を上回った。
  • 人間の検査者(1枚あたり平均33秒、精度59%、再現率68%)を上回り、AIRは1秒未満で1枚の画像を処理した。
  • MOBとSAR-APD評価スキームの組み合わせにより、正確な位置特定よりも検出の信頼性を重視する、より実用的で運用に即した性能プロファイルが実現された。
  • モデルは競争力のある推論速度(1枚あたり1秒)を示し、現場におけるリアルタイム展開に適していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。