Skip to main content
QUICK REVIEW

[論文レビュー] Small Object Detection for Near Real-Time Egocentric Perception in a Manual Assembly Scenario

Hooman Tavakoli, Snehal Walunj|arXiv (Cornell University)|Jun 11, 2021
Industrial Vision Systems and Defect Detection参考文献 17被引用数 6
ひとこと要約

本論文は、CADで生成された合成データと文脈認識を活用して、エゴセントリックARデバイスでの即時的要因認識のための2段階小物検出パイプラインを提案する。まず文脈(例:ブレッドボード)を検出し、その後にクロップして小さなボタンを再検出することで、IoU=0.10におけるmAPが70%に達し、1段階検出法を著しく上回る性能を達成した。

ABSTRACT

Detecting small objects in video streams of head-worn augmented reality devices in near real-time is a huge challenge: training data is typically scarce, the input video stream can be of limited quality, and small objects are notoriously hard to detect. In industrial scenarios, however, it is often possible to leverage contextual knowledge for the detection of small objects. Furthermore, CAD data of objects are typically available and can be used to generate synthetic training data. We describe a near real-time small object detection pipeline for egocentric perception in a manual assembly scenario: We generate a training data set based on CAD data and realistic backgrounds in Unity. We then train a YOLOv4 model for a two-stage detection process: First, the context is recognized, then the small object of interest is detected. We evaluate our pipeline on the augmented reality device Microsoft Hololens 2.

研究の動機と目的

  • ヘッドマウントARデバイスからの低解像度エゴセントリック動画ストリームにおける小物の検出という課題に対処すること。
  • 小さな物体用の実世界データが限られている問題を、CADモデルから高品質な合成データを生成することで克服すること。
  • 文脈知識を活用することで検出精度を向上させること—具体的には、物体の文脈(例:ブレッドボード)を最初に検出し、その後に小さな物体(例:ボタン)に焦点を当てる。
  • Microsoft HoloLens 2に搭載されたエッジデバイス上で、ニアリアルタイム推論(9.4 fps)を達成すること。
  • 階層的検出の有効性を評価し、誤検出の低減と小物に対するmAPの向上を検証すること。

提案手法

  • 小物(例:ボタン)のCADモデルを複数の視点、さまざまな照明条件および背景条件下でレンダリングすることで、Unity 3Dを用いて合成学習データを生成した。
  • 一般化性能を向上させるために、合成オブジェクトレンダリングと実世界の背景画像を組み合わせたドメインランダム化を実施した。
  • 2段階YOLOv4検出パイプラインを実装した:最初に文脈(ブレッドボード)を検出し、その後にクロップ領域内で小物(ボタン)を再検出する。
  • 1段階目のモデルはブレッドボードを検出する。2段階目のモデルは、クロップ領域で微調整された高解像度および文脈認識特徴を用いて小さなボタンを検出する。
  • 学習にはYOLOv4.conv.137からの転移学習を用い、データ拡張(回転、せん断)を適用し、実データ実験では2000エポックを実行した。
  • エッジ推論は、RTX 2080搭載のラップトップで実施し、ホロレンズ2のカメラストリームをリアルタイムで処理した。

実験結果

リサーチクエスチョン

  • RQ1CADモデルからの合成データ生成が、エゴセントリックARシナリオにおける小物検出性能を著しく向上させることができるか?
  • RQ2まず文脈を検出し、その後に小物に焦点を当てる2段階検出パイプラインが、1段階検出法と比較してmAPを向上させることができるか?
  • RQ3文脈認識により、照明条件や遮蔽が異なる実世界テストデータにおける誤検出を低減し、一般化性能を向上させることができるか?
  • RQ42段階パイプラインは、ホロレンズ2入力に対応したエッジデバイス上でニアリアルタイムのデプロイメントに十分な効率性を有するか?
  • RQ5実背景を用いたドメインランダム化により、合成学習データの一般化性能がどの程度向上するか?

主な発見

  • 実画像のみで学習した1段階モデルは、IoU=0.10におけるmAPがたった2.6%にとどまり、訓練データが限られているため一般化性能が著しく低いことが示された。
  • 3,800枚の大きな合成データセットで学習させたことで、ボタン検出のmAPがIoU=0.10で44%に向上し、合成データの利点が明らかになった。
  • 2段階パイプラインは、ボタン検出においてIoU=0.10でmAPが70%に達し、1段階アプローチに比べ顕著な向上を示した。
  • 2段階手法は文脈を活用することで誤検出を低減したことが、クロップ領域でのmAPが全画像検出よりも高いことから裏付けられた。
  • パイプラインはエッジデバイス上で9.4 fpsを達成し、産業用ARアプリケーションにおけるニアリアルタイム性能の基準を満たした。
  • CADベースの合成データ、ドメインランダム化、および階層的検出の組み合わせが、エゴセントリック環境における頑健な小物検出に不可欠であることが判明した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。