Skip to main content
QUICK REVIEW

[論文レビュー] Joint Hand Detection and Rotation Estimation by Using CNN

Xiaoming Deng, Ye Yuan|arXiv (Cornell University)|Dec 8, 2016
Hand Gesture Recognition Systems被引用数 4
ひとこと要約

本論文は、新しいデローテーション層を備えた畳み込みニューラルネットワーク(CNN)を用いて、手の検出と平面内回転推定を統合的に学習するためのディープラーニングフレームワークを提案する。このフレームワークにより、エンド・ツー・エンド最適化が可能となり、OxfordおよびEgohandsベンチマークで最先端の性能を達成した。推論時間は7倍短縮され、検出と回転推定の相互作用により検出精度が向上した。

ABSTRACT

Hand detection is essential for many hand related tasks, e.g. parsing hand pose, understanding gesture, which are extremely useful for robotics and human-computer interaction. However, hand detection in uncontrolled environments is challenging due to the flexibility of wrist joint and cluttered background. We propose a deep learning based approach which detects hands and calibrates in-plane rotation under supervision at the same time. To guarantee the recall, we propose a context aware proposal generation algorithm which significantly outperforms the selective search. We then design a convolutional neural network(CNN) which handles object rotation explicitly to jointly solve the object detection and rotation estimation tasks. Experiments show that our method achieves better results than state-of-the-art detection models on widely-used benchmarks such as Oxford and Egohands database. We further show that rotation estimation and classification can mutually benefit each other.

研究の動機と目的

  • 手首の回転やごみだらけの背景による外見の変動が著しい制御不能な環境における手の検出の課題に対処すること。
  • 検出と平面内回転推定を統合的に最適化することで、精度と効率を向上させること。
  • 選択的探索法やオブジェクトネスを上回る再現率および平均平均最高オーバーラップ(MABO)を達成する文脈に配慮した領域提案生成法を設計すること。
  • エンド・ツー・エンド学習を可能にする、微分可能で教師ありのデローテーション層を開発し、回転補正と検出を統合すること。
  • 明示的な回転推定により、ブルートフォースな回転探索を回避することで推論時間を短縮すること。

提案手法

  • 判別的特徴を活用することで、選択的探索法やオブジェクトネスを上回る再現率およびMABOを達成する文脈に配慮した提案生成アルゴリズムを提案する。
  • 予測された回転角度に基づいて特徴マップを明示的に真っすぐな方向に回転させるデローテーション層を導入し、エンド・ツー・エンド学習を可能にする。
  • 効率性を高めるために、共通の特徴抽出を共有する二重ストリームCNNアーキテクチャを採用し、回転推定と検出を同時に最適化する。
  • 平面内回転を予測する教師あり回転推定ネットワークを用い、その予測値に基づいてデローテーション層を介して入力提案領域を補正した後、検出を行う。
  • 固定サイズの特徴を抽出するため、回転した提案領域に対してROIプーリングを適用し、空間的一致性を保証する。
  • 検出と回転推定の両タスクを統合的に最適化することで、エンド・ツー・エンドにネットワークを訓練し、両タスクが互いに性能向上に寄与できるようにする。

実験結果

リサーチクエスチョン

  • RQ1検出と平面内回転推定を統合的に学習することで、別々に学習する場合と比較して検出精度が向上するか?
  • RQ2微分可能なデローテーション層による明示的な回転補正は、特徴学習とモデル一般化性能を向上させるか?
  • RQ3文脈に配慮した提案生成法は、選択的探索法やオブジェクトネスを著しく上回る再現率およびMABOを達成できるか?
  • RQ4統合学習により、性能を維持または向上させながら推論時間をどの程度短縮できるか?
  • RQ5回転推定の品質が検出性能に与える影響は何か。逆に、検出性能が回転推定に与える影響は何か?

主な発見

  • Oxfordデータセットでは、平均平均精度(mAP)が53.5%に達し、最先端のモデルを上回った。
  • Egohandsデータセットでは、統合モデルがmAP 75.7%を達成し、ベースライン手法(73.3%)を上回り、一般化性能の向上が示された。
  • Egohandsでは、10°以内の誤差で49.01%の精度、20°以内で76.68%の精度を達成し、回転推定において優れた性能を示した。
  • デローテーション層のおかげで、ブルートフォースな回転探索と比較して推論時間が7倍短縮され、1枚あたり8秒の処理時間となった。
  • 統合学習により、非統合学習モデルと比較して検出mAPが2%、回転推定精度が1%向上し、相互に利益をもたらすことが確認された。
  • 正解ラベルを用いて学習したモデルはmAP 50.9%を達成し、本手法はmAP 48.3%を達成した。最適化が強く、性能差が小さいことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。