Skip to main content
QUICK REVIEW

[論文レビュー] An Analysis of Deep Object Detectors For Diver Detection

Karin de Langis, Michael Fulton|arXiv (Cornell University)|Nov 25, 2020
Advanced Neural Network Applications参考文献 39被引用数 11
ひとこと要約

本稿は、105,000枚のアノテート済みダイバー画像を含む大規模なビデオベースのデータセットであるVideo Diver Detectionデータセット(VDD-100K)を紹介し、水中ロボティクスにおけるリアルタイムのダイバー検出のための深層学習オブジェクト検出器(SSD、YOLOv4、LSTM-SSDを含む)の性能を評価する。その結果、Tiny-YOLOv4およびSSDモデルがリアルタイムAUVアプリケーションにおける速度、精度、時間的安定性のバランスが最良であることが判明。ビデオベースのモデルは、検出の一貫性向上の可能性を示している。

ABSTRACT

With the end goal of selecting and using diver detection models to support human-robot collaboration capabilities such as diver following, we thoroughly analyze a large set of deep neural networks for diver detection. We begin by producing a dataset of approximately 105,000 annotated images of divers sourced from videos -- one of the largest and most varied diver detection datasets ever created. Using this dataset, we train a variety of state-of-the-art deep neural networks for object detection, including SSD with Mobilenet, Faster R-CNN, and YOLO. Along with these single-frame detectors, we also train networks designed for detection of objects in a video stream, using temporal information as well as single-frame image information. We evaluate these networks on typical accuracy and efficiency metrics, as well as on the temporal stability of their detections. Finally, we analyze the failures of these detectors, pointing out the most common scenarios of failure. Based on our results, we recommend SSDs or Tiny-YOLOv4 for real-time applications on robots and recommend further investigation of video object detection methods.

研究の動機と目的

  • 水中ロボティクスにおけるダイバー検出のための大規模かつビデオベースのデータセットの不足に対処すること。
  • 最先端の深層学習オブジェクト検出器が現実世界のロボット統合環境において、性能、安定性、効率性の観点でどのように機能するかを評価すること。
  • 部分的可視性や遮蔽に関連する、ダイバー検出システムにおける主な失敗モードを同定すること。
  • 水中環境におけるリアルタイムの人間-ロボット協働のための最適なモデル選定を支援すること。
  • ビデオベースのオブジェクト検出が、ダイバー追跡における時間的安定性の向上にどのように寄与するかを検討すること。

提案手法

  • プールおよび現場環境から収集した約105,000フレームのビデオを用いて、VDD-100Kデータセットを構築し、完全にアノテートされた画像を収集。さまざまなダイバーのポーズ、照明条件、運動状態を捉える。
  • 単一フレーム検出器(MobileNetv2/v3を搭載したSSD、YOLOv4、YOLOv4-tiny、Faster R-CNN)および時間的文脈を活用するビデオベース検出器(LSTM-SSD)を含む、複数の深層学習モデルを訓練。
  • 標準的なオブジェクト検出指標(精度、再現率、IOU閾値0.5、0.75、および0.5–0.95におけるmAP)に加え、時間的安定性指標(移動誤差、スケール誤差、断片化誤差)を導入してモデルを評価。
  • AUVのデプロイに向けたリアルタイム実現可能性を評価するため、GPUおよび組み込み型Jetson TX2プラットフォームでの推論速度を測定。
  • 誤検出(FN)の原因を特定するため、失敗事例を分析。特に、フレーム外への部分的包含と、他のダイバーによる遮蔽が主な要因であることが判明。
  • 公平な比較のため、すべてのモデルに対して信頼度閾値の最適化を実施し、精度と再現率のバランスを調整。

実験結果

リサーチクエスチョン

  • RQ1最先端の単一フレームおよびビデオベースのオブジェクト検出器は、大規模な水中ダイバー検出データセットにおいて、精度、安定性、推論速度の観点でどのように性能を発揮するか?
  • RQ2現実世界の水中ビデオストリームにおいて、深層学習ベースのダイバー検出器が最も一般的に発生させる失敗シナリオは何か?
  • RQ3ビデオオブジェクト検出における時間的文脈の統合は、単一フレームモデルと比較して、検出の安定性をどのように向上させるか?
  • RQ4組み込み型ロボットプラットフォームへのデプロイに適した、リアルタイム推論性能と検出精度の最良なトレードオフを達成するモデルは何か?
  • RQ5静止画像データセットと比較して、ビデオベースのデータセットは、動きや視点の変化に対するモデルの一般化能力および耐障害性をどの程度向上させるか?

主な発見

  • Jetson TX2上で、YOLOv4-Tinyが35 FPSという最高の推論速度を記録し、リアルタイム組み込みデプロイ環境において他のモデルを上回った。
  • LSTM-SSDは、標準的なSSDバージョンと比較して断片化誤差が低く、時間的整合性に優れていることが示されたが、推論時間はやや長かった。
  • YOLOv4およびYOLOv4-Tinyは、すべてのモデルの中で断片化誤差が最小であり、境界ボックス追跡における時間的安定性が優れていた。
  • 最も一般的な失敗モードは、フレームに完全に収まっていないダイバー(エッジケース)と、他のダイバーによる遮蔽であり、誤検出の大部分を占めていた。
  • MobileNetv3-Largeを搭載したSSDおよびMobileNetv2を搭載したSSDは、高い精度と妥当な推論速度を達成しており、速度よりも一貫性が求められる応用に適していた。
  • mAPが低めであったものの、LSTM-SSDは断片化が少なく、推論速度が速いため、ビデオベース検出の可能性を示しており、今後の動的検出手法のさらなる検討が求められる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。