Skip to main content
QUICK REVIEW

[論文レビュー] Kinship Verification from Videos using Spatio-Temporal Texture Features and Deep Learning

Elhocine Boutellaa, Miguel Bordallo López|arXiv (Cornell University)|Aug 14, 2017
Face recognition and analysis被引用数 6
ひとこと要約

本論文では、空間的時間的テクスチャ特徴(LBP、LPQ、BSIFを3つの直交平面に適用)と事前学習済み畳み込みニューラルネットワーク(CNN)からの深層特徴を用いた動画ベースの親族関係検証手法を提案する。UvA-NEMO Smileデータベースにおけるこれらの特徴の統合により、平均検証精度が90.98%に達し、特定の親族関係タイプにおいては最先端手法を最大23%上回る性能を示した。

ABSTRACT

Automatic kinship verification using facial images is a relatively new and challenging research problem in computer vision. It consists in automatically predicting whether two persons have a biological kin relation by examining their facial attributes. While most of the existing works extract shallow handcrafted features from still face images, we approach this problem from spatio-temporal point of view and explore the use of both shallow texture features and deep features for characterizing faces. Promising results, especially those of deep features, are obtained on the benchmark UvA-NEMO Smile database. Our extensive experiments also show the superiority of using videos over still images, hence pointing out the important role of facial dynamics in kinship verification. Furthermore, the fusion of the two types of features (i.e. shallow spatio-temporal texture features and deep features) shows significant performance improvements compared to state-of-the-art methods.

研究の動機と目的

  • 静止画像ではなく動画シーケンスを用いることで、顔の動きの役割が親族関係検証に与える影響を調査すること。
  • 空間的時間的テクスチャ特徴(LBP、LPQ、BSIFをTOPに適用)が親族関係に関連する顔のパターンをどれだけ効果的に捉えられるかを検討すること。
  • 事前学習済みCNNからの深層特徴が動画文脈における親族関係検証にどの程度有効であるかを評価すること。
  • 浅層的な空間的時間的特徴と深層特徴を後期統合することで、検証精度を向上させること。
  • 動画ベースの親族関係検証が静止画像ベースのものよりも優れていることを実証すること。

提案手法

  • 目の座標を用いた顔検出、セグメンテーション、アライメントにより、動画フレーム間での顔領域を標準化する。
  • 動画シーケンスの3つの直交平面(TOP)から空間的時間的テクスチャ特徴(LBP、LPQ、BSIF)を抽出し、顔の動きをモデル化する。
  • 個々の顔フレームから事前学習済み畳み込みニューラルネットワーク(CNN)を用いて深層特徴を抽出する。
  • スコアレベルでの統合により、空間的時間的特徴と深層特徴を単純な加算で統合し、識別力を強化する。
  • 支持ベクターマシン(SVM)を用いて統合された特徴ベクトルを分類し、親族関係検証を実行する。
  • 標準的な親族関係検証プロトコルとROC分析を用いて、UvA-NEMO Smile動画データベース上で評価する。

実験結果

リサーチクエスチョン

  • RQ1静止画像と比較して、動画シーケンスを用いることで親族関係検証の性能が向上するか?
  • RQ2空間的時間的テクスチャ特徴(LBP、LPQ、BSIFをTOPに適用)は、親族関係に関連する顔の動きをどれだけ効果的に捉えられるか?
  • RQ3事前学習済みCNNからの深層特徴は、動画からの親族関係検証において、手作業で設計された特徴を上回る性能を示せるか?
  • RQ4浅層的な空間的時間的特徴と深層特徴を統合することで、個々の特徴タイプに比べて顕著な性能向上が得られるか?
  • RQ5年齢差や性別差が大きい親族関係タイプ(例:M-S、F-D)において、性能にどのような差が生じるか?

主な発見

  • 動画ベースの親族関係検証は、静止画像ベースの手法を著しく上回り、親族認識において顔の動きの重要性を示している。
  • 事前学習済みCNNから抽出した深層特徴は、UvA-NEMO Smileデータセット全体で平均89.79%の検証精度を達成し、すべての先行手法を上回った。
  • 空間的時間的テクスチャ特徴と深層特徴の統合により、平均精度が90.98%に達し、前回の最先端手法比で18%以上の向上を達成した。
  • 特に困難な親族関係タイプ(M-S:4.8%の向上、F-D:3.4%の向上)で顕著な性能向上が見られ、性別や年齢差に対しても本手法の頑健性が示された。
  • M-S関係サブセットでは、本手法が90.49%の精度を達成し、最高の先行手法(Dibekliogluら)を23%上回った。
  • 静止画像設定でも、深層特徴は空間的テクスチャ特徴および動画から抽出された空間的時間的特徴を上回り、強力な識別力を持つことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。