Skip to main content
QUICK REVIEW

[論文レビュー] Deep ChArUco: Dark ChArUco Marker Pose Estimation

Danying Hu, Daniel DeTone|arXiv (Cornell University)|Dec 8, 2018
Robotics and Sensor-Based Localization参考文献 17被引用数 4
ひとこと要約

本論文は、従来のOpenCV手法が失敗する極端な照明条件および運動量の高い状況下でも、安定した6DoFの姿勢推定を実現するリアルタイムで深層学習ベースのシステム、Deep ChArUcoを提案する。2つのヘッドを持つ畳み込みニューラルネットワーク(ChArUcoNet)を用いてマーカーIDの分類と2次元コーナー検出を同時に実行し、粗い検出結果を局所的な8×8領域上で学習された回帰により精度を向上させるサブピクセル補正ネットワーク(RefineNet)を組み合わせ、極端な増幅処理を施した合成データおよび自動ラベル付与されたデータで訓練することで、低照度および高ブラー状況下でも優れた精度と耐障害性を達成した。

ABSTRACT

ChArUco boards are used for camera calibration, monocular pose estimation, and pose verification in both robotics and augmented reality. Such fiducials are detectable via traditional computer vision methods (as found in OpenCV) in well-lit environments, but classical methods fail when the lighting is poor or when the image undergoes extreme motion blur. We present Deep ChArUco, a real-time pose estimation system which combines two custom deep networks, ChArUcoNet and RefineNet, with the Perspective-n-Point (PnP) algorithm to estimate the marker's 6DoF pose. ChArUcoNet is a two-headed marker-specific convolutional neural network (CNN) which jointly outputs ID-specific classifiers and 2D point locations. The 2D point locations are further refined into subpixel coordinates using RefineNet. Our networks are trained using a combination of auto-labeled videos of the target marker, synthetic subpixel corner data, and extreme data augmentation. We evaluate Deep ChArUco in challenging low-light, high-motion, high-blur scenarios and demonstrate that our approach is superior to a traditional OpenCV-based method for ChArUco marker detection and pose estimation.

研究の動機と目的

  • 低照度および高運動ブラー状況下で従来のOpenCVベースのChArUco検出が失敗する問題を解決すること。
  • 厳しい視覚的条件下でも、拡張現実およびロボット工学の応用に適したリアルタイムで耐障害性の高いマーカー検出システムを開発すること。
  • 深層学習と古典的なPnPアルゴリズムを組み合わせることで、6DoFの姿勢回復における姿勢推定精度を向上させること。
  • 希少な視覚的条件下でのデータ不足を克服するため、合成データと自動ラベル付与された実写動画を活用したトレーニングパイプラインを設計すること。
  • 影、低照度、または運動ブラーによって古典的手法が失敗する状況下でも、ChArUcoマーカーの信頼性の高い検出を可能にすること。

提案手法

  • 各検出されたChArUcoパターンのマーカーIDと2次元コーナー位置を同時に予測する、2ヘッドの完全畳み込みニューラルネットワーク(ChArUcoNet)を提案する。
  • ChArUcoNetが得た粗い検出結果を、局所的な8×8領域上で学習された回帰を用いて、より高精度なコーナー局所化を実現するサブピクセル補正ネットワーク(RefineNet)を導入する。
  • 実写動画の自動ラベル付与と合成されたサブピクセル精度の高いコーナー情報のハイブリッドデータパイプラインを用いて、ネットワークをトレーニングする。
  • ランダムな照明変化、運動ブラー、影のシミュレーションを含む極端なデータ増幅処理を適用し、悪条件下での耐障害性を向上させる。
  • Perspective-n-Point(PnP)アルゴリズムを用いて、深層ネットワークが得た精錬された2次元-3次元対応点から6DoFの姿勢を計算する。
  • 完全畳み込み構造を活かしたChArUcoNetの特性を活用し、さまざまな解像度での処理を可能とするとともに、RefineNetによる高解像度補正をオプションで実行することで、リアルタイム推論を実現する。

実験結果

リサーチクエスチョン

  • RQ1深層学習は、OpenCVが失敗する低照度および高運動ブラー状況下でのChArUcoマーカー検出および姿勢推定の耐障害性を向上させることができるか?
  • RQ2極端な視覚的条件下で、2段階の深層学習パイプライン(検出+サブピクセル補正)は、古典的手法によるコーナー補正よりも効果的か?
  • RQ3合成データと自動ラベル付与された実データの組み合わせにより、人的ラベル付けの必要性をどの程度低減できるか?
  • RQ4極端なデータ増幅処理を施したパターン特化型ネットワークは、一般用途向け検出手法に比べ、著しく優れた性能を発揮するか?
  • RQ5提案手法は、悪条件下の照明および運動ブラー状況下でも、サブピクセル精度を維持しながらリアルタイム性能を確保できるか?

主な発見

  • 3ルクス以上の照度下の26のテストシーケンスにおいて、Deep ChArUcoは100%の検出精度を達成したのに対し、OpenCVは1ルクス以下では完全に失敗した。
  • 影のある状況(例:100ルクスで影がかかる)において、Deep ChArUcoは100%の精度(平均再投影誤差:0.102ピクセル)を維持したが、OpenCVは30.1%の精度(平均再投影誤差:0.116ピクセル)にとどまった。
  • 運動ブラー状況下では、Deep ChArUcoは80.3%の精度(平均再投影誤差:1.347ピクセル)を達成し、OpenCVの31.1%の精度(平均再投影誤差:0.160ピクセル)を大きく上回った。
  • 運動ブラーを除くすべての条件下で、RefineNetは再投影誤差を低減した。特に低照度条件下で最も顕著な改善が見られ、0.3ルクスでの誤差は0.858ピクセルから0.427ピクセルに低下した。
  • システムはリアルタイムで動作し、GTX 1080 GPU上で320×240の画像を30 FPS以上で処理可能であり、RefineNetを適用した場合の推論時間は98.6 msであった。
  • 自動ラベル付与された動画と合成されたサブピクセルデータの組み合わせにより、人的ラベル付けをほとんど行わずとも高性能なトレーニングが可能となり、データパイプラインの有効性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。