Skip to main content
QUICK REVIEW

[論文レビュー] Dockerface: an Easy to Install and Use Faster R-CNN Face Detector in a Docker Container

Nataniel Ruiz, James M. Rehg|arXiv (Cornell University)|Aug 15, 2017
Face recognition and analysis参考文献 12被引用数 11
ひとこと要約

Dockerface は、Linux での簡単なデプロイを可能にする Docker コンテナにパckされた事前学習済み Faster R-CNN フェイス検出器であり、複雑なインストールやトレーニングを不要にします。実世界の子供の相互作用動画において、広く使われている Dlib や OpenCV、OMRON よりも優れた最新の精度(IOU 0.5 で 98% のリコール)を達成しています。

ABSTRACT

Face detection is a very important task and a necessary pre-processing step for many applications such as facial landmark detection, pose estimation, sentiment analysis and face recognition. Not only is face detection an important pre-processing step in computer vision applications but also in computational psychology, behavioral imaging and other fields where researchers might not be initiated in computer vision frameworks and state-of-the-art detection applications. A large part of existing research that includes face detection as a pre-processing step uses existing out-of-the-box detectors such as the HoG-based dlib and the OpenCV Haar face detector which are no longer state-of-the-art - they are primarily used because of their ease of use and accessibility. We introduce Dockerface, a very accurate Faster R-CNN face detector in a Docker container which requires no training and is easy to install and use.

研究の動機と目的

  • 最新のディープラーニング手法が利用可能であるにもかかわらず、研究分野で古く、精度が低いフェイス検出器(例:OpenCV Haar や Dlib HOG)が広く使われている問題に対処すること。
  • Caffe のインstールや GPU の設定、事前学習済みモデルの欠如といった、最先端のフェイス検出技術の採用を妨げる障壁を克服すること。
  • ディープラーニングの専門知識が不足するコンピュータビジョン、心理学、行動画像分野の研究者にとって、即座に利用可能で再現可能かつアクセス可能なソリューションを提供すること。
  • 自閉症を示す子供における社会的行動分析などの実世界の応用で、正確なフェイス検出を可能にし、検出エラーがデータ損失を引き起こすのを防ぐこと。
  • 下流タスクの信頼性を向上させるために、性能が劣る事前処理用検出器に代わる、高精度で簡単にデプロイ可能な代替手段を提供すること。

提案手法

  • WIDER Face データセットで学習された Faster R-CNN フェイス検出モデルを再現し、Jiang よりも Miller が示したように最先端のパフォーマンスを達成すること。
  • 事前学習済み Faster R-CNN モデル、Caffe フレームワーク、動画対応の OpenCV、GPU 対応ライブラリを1つのポータブル Docker コンテナにパッケージ化すること。
  • Caffe と OpenCV の GPU 対応のコンパイルと設定を自動化し、手動でのセットアップや依存関係の衝突を排除すること。
  • 画像および動画の推論用に事前に作成された Python スクリプトを含め、入出力の処理を明確にし、CPU および GPU 実行の両方をサポートすること。
  • Docker を使用して、軽量でハードウェアに依存しないコンテナ環境にモデルを統合し、システム間での一貫性あるデプロイを保証すること。
  • コミュニティによる採用と拡張を促進するため、詳細なステップバイステップの説明と、https://github.com/natanielruiz/dockerface でのオープンソースコードを提供すること。

実験結果

リサーチクエスチョン

  • RQ1複雑なインストールや設定の障壁を解消するために、事前学習済み Faster R-CNN フェイス検出器を Docker コンテナにパッケージ化できるか?
  • RQ2子供の相互作用研究から得た現実的で困難な動画データにおいて、Dockerface のパフォーマンスは、広く使われている即時利用可能な検出器(OpenCV、Dlib、OMRON)と比べてどうか?
  • RQ3Dockerface のような高精度なフェイス検出器を用いることで、顔のランドマーク検出や社会的行動分析などの下流タスクにおけるデータ損失はどの程度削減されるか?
  • RQ4微調整なしで、Docker化された事前学習済み Faster R-CNN モデルが、ベンチマークデータセット上で元の実装と同等またはそれ以上の精度を達成できるか?
  • RQ5Docker コンテナに GPU 対応と動画処理ライブラリを統合することで、リアルタイムアプリケーションにおける使いやすさが顕著に向上するか?

主な発見

  • 3分間の子供と大人の相互作用動画において、Dockerface は IOU 0.5 で 98% のリコール、IOU 0.75 で 93% のリコールを達成し、OpenCV(IOU 0.5 で 40%、IOU 0.75 で 3%)を大きく上回りました。
  • より困難な動画シーケンスでは、Dockerface は IOU 0.5 で 91%、IOU 0.75 で 73% のリコールを達成しました。これに対して Dlib は 77% と 69%、OpenCV は 9% と 1%、OMRON は 36% と 1% でした。
  • 高い検出感度に加え、誤検出率も低く抑えられるよう、98% の高精度(IOU 0.5 時)を維持しており、良好な性能を示しています。
  • Dockerface は、部分的遮蔽や低解像度画像などの困難な状況でも顔を正確に検出でき、他の検出器が失敗する状況でもデータ損失を低減します。
  • 手動による Caffe のコンパイル、GPU ドライバの設定、OpenCV の再コンパイルの必要がなくなり、Linux システム上でワンクリックでデプロイ可能になりました。
  • 詳細なドキュメンテーションと事前ビルド済みスクリプトを備えたオープンソースリリースにより、ディープラーニングの専門知識が不足する研究者でも、最小限の努力で高精度なフェイス検出をパイプラインに統合できます。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。