Skip to main content
QUICK REVIEW

[論文レビュー] Bringing Cartoons to Life: Towards Improved Cartoon Face Detection and Recognition Systems

Saurav Jha, Nikhil Agarwal|arXiv (Cornell University)|Apr 5, 2018
Face recognition and analysis参考文献 32被引用数 10
ひとこと要約

本稿では、MTCNNを用いた検出と、顔のキーポイント座標を統合した2つの新規モデル——Inception v3+SVMおよびハイブリッドCNN(HCNN)——を用いた、アニメ顔検出および認識のためのディーブラーニングベースのフレームワークを提案する。HCNNモデルはクラス多様性に優れた安定性を示す一方、Inception v3+SVMは、アニメ顔の性別認識においてF1スコア0.910という新たな最先端水準を達成した。

ABSTRACT

Given the recent deep learning advancements in face detection and recognition techniques for human faces, this paper answers the question "how well would they work for cartoons'?" - a domain that remains largely unexplored until recently, mainly due to the unavailability of large scale datasets and the failure of traditional methods on these. Our work studies and extends multiple frameworks for the aforementioned tasks. For face detection, we incorporate the Multi-task Cascaded Convolutional Network (MTCNN) architecture and contrast it with conventional methods. For face recognition, our two-fold contributions include: (i) an inductive transfer learning approach combining the feature learning capability of the Inception v3 network and the feature recognizing capability of Support Vector Machines (SVMs), (ii) a proposed Hybrid Convolutional Neural Network (HCNN) framework trained over a fusion of pixel values and 15 manually located facial keypoints. All the methods are evaluated on the Cartoon Faces in the Wild (IIIT-CFW) database. We demonstrate that the HCNN model offers stability superior to that of Inception+SVM over larger input variations, and explore the plausible architectural principles. We show that the Inception+SVM model establishes a state-of-the-art F1 score on the task of gender recognition of cartoon faces. Further, we introduce a small database hosting location coordinates of 15 points on the cartoon faces belonging to 50 public figures of the IIIT-CFW database.

研究の動機と目的

  • 芸術的変化と限られたデータセットの影響により、アニメ顔検出および認識のための堅牢なディーブラーニングシステムが不足しているという問題に対処すること。
  • 従来の手法(HOGやハール特徴)を上回る性能を達成するアニメ顔検出の向上を図ること。
  • 顔のキーポイント位置を統合した新規ディーブラーニングアーキテクチャの開発および評価を行い、認識精度の向上を図ること。
  • 検出および認識タスクのためのIIIT-CFWアニメ顔データセット上で最先端のベンチマークを確立すること。
  • 今後の研究を支援するため、IIIT-CFWデータセットの50人の有名人の15点の顔のキーポイント座標を含む新しいデータセットを公開すること。

提案手法

  • MTCNNアーキテクチャを用いてアニメ顔検出を実装し、HOGおよびハール特徴ベースの検出器と性能を比較する。
  • 事前学習済みのInception v3ネットワークを特徴抽出器として用い、その後にSVMおよび勾配ブースティング分類器を適用して認識を実行する。
  • rawピクセル値と手動でアノテートされた15点の顔のキーポイント座標を統合した、エンドツーエンドで学習可能なハイブリッドCNN(HCNN)を提案する。
  • HCNNではスキップ接続とバッチ正則化を用いて学習の安定性を高め、収束を改善する。
  • データオーグメンテーションとエアリー・ストッピングを用いて、IIIT-CFWデータセット上でモデルを学習し、過学習を防止する。
  • クラス数や入力の変異に応じて、F1スコア、トップ5誤差率、精度、再現率、正解率などの指標を用いてモデルを評価する。

実験結果

リサーチクエスチョン

  • RQ1MTCNNは、芸術的変化が著しいアニメ顔に対して、HOGやハール特徴といった従来手法と比較して、どの程度優れた性能を示すか?
  • RQ2手動でアノテートされた顔のキーポイント座標を統合することで、アニメ顔認識モデルのロバスト性と精度が向上するか?
  • RQ3クラス数が増加する際、提案されたHCNNフレームワークはInception v3+SVMモデルを上回る安定性を示すか?
  • RQ4提案されたモデルは、アニメ顔の性別認識タスクでどの程度の性能を示し、最先端の結果を達成するか?
  • RQ5なぜInception v3+SVMモデルはクラス多様性が増加するにつれて安定性が低下するのか?また、HCNNはその問題をどのように緩和するか?

主な発見

  • MTCNNフレームワークは、特に正面顔において、真陽性率(TPR)、偽陽性率(FPR)、偽陰性率(FNR)の観点で、先行研究の顔の輪郭と対称性に基づく検出器[14]を上回った。
  • Inception v3+SVMモデルは、性別認識タスクにおいて、F1スコア0.910という最先端水準を達成し、この特定の指標でHCNNモデルを上回った。
  • 顔のキーポイント座標を入力に含めることで、HCNNモデルはベースラインと比較してトップ5誤差率を5.87%低減した。
  • クラス数が20から100に増加するに従い、HCNNとInception v3+SVMの性能差は縮小し、最終的にはトップ5誤差率においてHCNNが後者を上回った。
  • Conv2D層の後にスキップ接続を配置する(BN層の後に配置するのではなく)ことで、学習の安定性が著しく向上し、収束に要するエポック数が103から47に減少した。
  • クラス多様性が増加する条件下でも、HCNNモデルはInception v3+SVMモデルよりも高い安定性を示し、大規模なアニメ顔認識における一般化性能の優位性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。