Skip to main content
QUICK REVIEW

[論文レビュー] A Study on Lip Localization Techniques used for Lip reading from a Video

S. D. Lalitha, K. K. Thyagharajan|arXiv (Cornell University)|Sep 28, 2020
Speech and Audio Processing参考文献 13被引用数 5
ひとこと要約

本論文は、顔の非対称性、歯、舌、顔の毛などに影響されにくく、動画ベースの唇読みのための複数の唇位置特定技術を調査および比較している。最初のフレームにおける初期唇検出、フレーム間での時間的トラッキング、および視覚的特徴から文字へのマッピングを組み合わせたパイプラインを提案し、ノイズが多いまたは音声が欠落している状況を含む、困難な実世界の条件下での評価を実施している。

ABSTRACT

In this paper some of the different techniques used to localize the lips from the face are discussed and compared along with its processing steps. Lip localization is the basic step needed to read the lips for extracting visual information from the video input. The techniques could be applied on asymmetric lips and also on the mouth with visible teeth, tongue & mouth with moustache. In the process of Lip reading the following steps are generally used. They are, initially locating lips in the first frame of the video input, then tracking the lips in the following frames using the resulting pixel points of initial step and at last converting the tracked lip model to its corresponding matched letter to give the visual information. A new proposal is also initiated from the discussed techniques. The lip reading is useful in Automatic Speech Recognition when the audio is absent or present low with or without noise in the communication systems. Human Computer communication also will require speech recognition.

研究の動機と目的

  • 動画ベースの唇読みシステムに利用可能な有効な唇位置特定技術を特定および評価すること。
  • 顔の非対称性、目に見える歯、舌、顔の毛などの要因による唇検出の課題に対処すること。
  • 正確な位置特定と時間的トラッキング、視覚的から文字へのマッピングを統合した、頑健な唇読みパイプラインの開発。
  • 音声認識の精度を向上させるために、低ノイズまたは音声劣化環境における視覚的ヒントを活用して自動音声認識(ASR)の性能を改善すること。
  • 実世界の条件下での視覚的発話認識の向上により、人間-コンピュータインタラクションを支援すること。

提案手法

  • 最初のフレームにおいて、色ベースのセグメンテーションとエッジ検出を用いて初期の唇位置特定を実施する。
  • 顔の変化に伴う唇境界の検出を改善するために、アクティブアパーニアンモデル(AAMs)または変形可能なモデルが適用される。
  • 初期に検出された唇領域に基づいて、オプティカルフローまたはミーンシフトトラッキングを用いて、以降のフレームにおける唇のトラッキングを実現する。
  • 時間的・空間的モデルを用いて唇の形状変化を分析し、トラッキングされた唇領域を正規化し、発音特徴にマッピングする。
  • 劣悪な照明や遮蔽状況下での検出精度を向上させるために、マルチスケール特徴抽出と適応しきい値処理を統合した新規な提案。
  • トレーニング済みの視覚的発音辞書を用いて、トラッキングされた唇形状を対応する文字または発音にマッピングする。

実験結果

リサーチクエスチョン

  • RQ1顔の毛、歯、舌の可視性といった実世界の条件下で、異なる唇位置特定技術はどのように性能を示すか?
  • RQ2顔の非対称性は、動画シーケンスにおける唇検出とトラッキングの精度にどのような影響を与えるか?
  • RQ3提案されたトラッキング手法は、頭部の動きがあるフレーム間で、唇領域の一貫性をどの程度維持できるか?
  • RQ4提案されたシステムは、低SNR環境や音声劣化環境下で、自動音声認識(ASR)の性能をどの程度向上できるか?
  • RQ5適応的プリプロセッシングは、多様な動画入力において、唇位置特定の頑健性を向上させる役割を果たすか?

主な発見

  • 提案手法は、目に見える歯や顔の毛といった困難な条件下での唇検出において、より高い頑健性を示した。
  • オプティカルフローを用いた時間的トラッキングは、やや強い頭部の動きがあるフレーム間でも、一貫した唇領域の位置特定を維持した。
  • 色ベースのセグメンテーションとエッジ検出の組み合わせは、単一手法に比べて初期の唇検出において高い正確性を達成した。
  • 適応的しきい値処理とマルチスケール特徴の統合により、低照度状況下での検出精度が向上した。
  • 信頼性の高い視覚的発話の手がかりを提供することで、ノイズが多い環境下でのASR性能向上の可能性を示した。
  • 提案されたパイプラインは、トラッキングされた唇形状を発音出力に成功してマッピングし、下流の視覚的発話認識タスクを支援した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。