Skip to main content
QUICK REVIEW

[論文レビュー] Deep Learning-based Spatio Temporal Facial Feature Visual Speech Recognition

Pangoth Santhosh Kumar, Garika Akshay|arXiv (Cornell University)|Apr 30, 2023
Face recognition and analysis被引用数 4
ひとこと要約

この論文では、ビデオからの空間的・時間的顔特徴とLSTMネットワークを組み合わせることで、低リソースデバイス上で安全でパスワードベースの認証を実現する深層学習ベースのビジュアルスピーチ認識システムを提案する。モデルはMIRACL-VC1データセットで96.1%の精度を達成し、10枚の正例トレーニング動画のみでさえもスプーフィング攻撃に対して効果的に耐性を示す。言語や音声に依存しない。

ABSTRACT

In low-resource computing contexts, such as smartphones and other tiny devices, Both deep learning and machine learning are being used in a lot of identification systems. as authentication techniques. The transparent, contactless, and non-invasive nature of these face recognition technologies driven by AI has led to their meteoric rise in popularity in recent years. While they are mostly successful, there are still methods to get inside without permission by utilising things like pictures, masks, glasses, etc. In this research, we present an alternate authentication process that makes use of both facial recognition and the individual's distinctive temporal facial feature motions while they speak a password. Because the suggested methodology allows for a password to be specified in any language, it is not limited by language. The suggested model attained an accuracy of 96.1% when tested on the industry-standard MIRACL-VC1 dataset, demonstrating its efficacy as a reliable and powerful solution. In addition to being data-efficient, the suggested technique shows promising outcomes with as little as 10 positive video examples for training the model. The effectiveness of the network's training is further proved via comparisons with other combined facial recognition and lip reading models.

研究の動機と目的

  • 写真やマスクを用いたスプーフィング攻撃に対して脆弱な静的顔認識システムの課題を解決すること。
  • 発話中の動的顔の動きを活用することで、静的顔特徴を上回るセキュリティを実現するバイオメトリクス認証システムを開発すること。
  • スマートフォンなどの低リソースデバイスに適した、言語に依存せず音声を必要としない認証手法を構築すること。
  • さまざまな照明や環境条件下でも高い精度と耐性を維持すること。
  • 強力なパフォーマンスを維持しながらデータ要件を最小限に抑え、エッジデバイスへの展開を可能にすること。

提案手法

  • 事前学習済みのVGGFaceモデルが、顔のアイデンティティ固有の空間パターンを捉えるためにビデオフレームから深層顔特徴を抽出する。
  • 抽出された顔特徴の系列を、発話中の顔の動きの時間的ダイナミクスをモデル化するための、スタックされた長短期記憶(LSTM)ネットワークに供給する。
  • トレーニング中にパスワードの内容を知る必要がなく、与えられた動画クリップが事前に選択されたパスワードを発話している真正ユーザーに該当するかどうかを分類するようにモデルを学習する。
  • 本システムはMIRACL-VC1ベンチマークデータセットおよび、実際の多様な条件下でスマートフォンカメラから収集したカスタムデータセットで評価される。
  • 正解率、特異度、感度、AUC、および等誤差率(EER)などの指標を用いてモデルのパフォーマンスを評価する。
  • データ効率的なアーキテクチャを設計しており、各ユーザーに対して10枚の正例動画で効果的なトレーニングが可能である。
Figure 1: Proposed Architecture built on VGGFace
Figure 1: Proposed Architecture built on VGGFace

実験結果

リサーチクエスチョン

  • RQ1顔認識と時間的顔の動き解析を組み合わせた深層学習モデルは、静的顔認識よりも高いセキュリティを実現できるか?
  • RQ2実世界の展開において、照明、背景、動画品質の変動にどのように一般化するか?
  • RQ3最小限のデータでトレーニングできる範囲はどこまでで、高い精度と耐性を維持できるか?
  • RQ4本システムは、同一人物および異なる人物によるスプーフィング攻撃をどの程度効果的に検出できるか?
  • RQ5高いパフォーマンスを維持しながら、言語に依存せず音声を必要としない認証システムを構築できるか?

主な発見

  • 提案されたモデルはMIRACL-VC1データセットで96.1%の精度を達成し、ビジュアルスピーチ認識分野での強力なパフォーマンスを示した。
  • 本システムは高い特異度(95.9%)と感度(98.8%)を維持しており、真正ユーザーと模倣者を効果的に検出できることを示した。
  • MIRACL-VC1では等誤差率(EER)が0.021、カスタムデータセットでは0.030であり、誤認証と誤拒否率が低いことを示した。
  • MIRACL-VC1ではAUCスコアが0.990、カスタムデータセットでは0.989であり、優れた識別能力を示した。
  • ユーザー1人あたり10枚の正例動画でさえも有効であり、データ効率性が顕著に示された。
  • 本モデルは、顔認識とリップリーディングの最先端モデルを統合した場合よりも、耐性とスプーフィング攻撃への耐性において優れた性能を示した。
Figure 2: Data Preprocessing Pipeline
Figure 2: Data Preprocessing Pipeline

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。