Skip to main content
QUICK REVIEW

[論文レビュー] A three-dimensional approach to Visual Speech Recognition using Discrete Cosine Transforms

Toni Heidenreich, Michael Spratling|arXiv (Cornell University)|Sep 7, 2016
Speech and Audio Processing参考文献 43被引用数 4
ひとこと要約

本稿では、視覚的発話認識のための新しい3次元離散コサイン変換(DCT)ベースの手法を提案する。この手法は、動画のすべての可能な部分列から空間時間的特徴を抽出し、SVMを用いて分類し、独自の隠れマルコフモデル(HMM)を用いて結果を統合する。視声素列では39%の正確度を達成し、子音素列では20%を達成しており、先行研究より約2%向上し、連続認識において3次元特徴が2次元手法を上回ることを初めて示した。また、二音素(biphones)が正確度を顕著に向上させることも証明した。

ABSTRACT

Visual speech recognition aims to identify the sequence of phonemes from continuous speech. Unlike the traditional approach of using 2D image feature extraction methods to derive features of each video frame separately, this paper proposes a new approach using a 3D (spatio-temporal) Discrete Cosine Transform to extract features of each feasible sub-sequence of an input video which are subsequently classified individually using Support Vector Machines and combined to find the most likely phoneme sequence using a tailor-made Hidden Markov Model. The algorithm is trained and tested on the VidTimit database to recognise sequences of phonemes as well as visemes (visual speech units). Furthermore, the system is extended with the training on phoneme or viseme pairs (biphones) to counteract the human speech ambiguity of co-articulation. The test set accuracy for the recognition of phoneme sequences is 20%, and the accuracy of viseme sequences is 39%. Both results improve the best values reported in other papers by approximately 2%. The contribution of the result is three-fold: Firstly, this paper is the first to show that 3D feature extraction methods can be applied to continuous sequence recognition tasks despite the unknown start positions and durations of each phoneme. Secondly, the result confirms that 3D feature extraction methods improve the accuracy compared to 2D features extraction methods. Thirdly, the paper is the first to specifically compare an otherwise identical method with and without using biphones, verifying that the usage of biphones has a positive impact on the result.

研究の動機と目的

  • 2次元特徴抽出の限界を解消するため、発話の開始時刻と持続時間が不明であるため、時間的ダイナミクスを捉えられないこと。
  • 連続動画系列からの空間時間的特徴抽出に、3次元離散コサイン変換(DCT)を効果的に適用できるかを検証する。
  • 連続する子音素のペア(二音素)を組み込むことで、共鳴効果の影響を軽減し、認識正確度が向上するかを調査する。
  • 個々の部分列分類結果を統合し、一貫性のある子音素または視声素系列を生成する、カスタマイズされた隠れマルコフモデル(HMM)を開発する。
  • VidTimitデータセット上で本手法を評価し、同一条件下で既存手法と性能を比較する。

提案手法

  • 一貫した入力を保証するため、頑健なモデルベースのトラッキング手法を用いて動画フレームから口元領域を分離する。
  • すべての可能な部分列から空間時間的特徴を抽出するために、3次元離散コサイン変換(DCT)を適用し、時間的経過に伴う動きと形状のダイナミクスを捉える。
  • 各部分列を、3次元DCT係数に基づいてトレーニングされたサポートベクターマシン(SVM)を用いて独立して分類し、最も可能性の高い子音素または視声素を予測する。
  • 個々の部分列予測結果を、時間的遷移を考慮して、グローバルに最適な子音素または視声素系列に統合する、独自の隠れマルコフモデル(HMM)を用いる。
  • 2つの主要な補正策を導入:音声・視覚のタイミングオフセットを是正するための逆シフトトレーニングデータの使用、および共鳴効果による曖昧さを低減するための二音素の導入。
  • 部分列の開始時刻と持続時間が不確実である問題に対処するため、各開始時刻と持続時間の確率を計算し、HMMデコーディングにより最良の系列を選択する。

実験結果

リサーチクエスチョン

  • RQ1発話の開始時刻と持続時間が不明であるにもかかわらず、3次元離散コサイン変換(DCT)特徴を連続的視覚的発話認識に効果的に適用できるか?
  • RQ23次元空間時間的特徴の使用は、従来の2次元フレームレベル特徴抽出法と比較して、認識正確度を向上させるか?
  • RQ3連続する子音素のペア(二音素)を組み込むことで、単一の子音素を使用する場合と比較して、認識正確度はどの程度向上するか?
  • RQ4カスタマイズされた隠れマルコフモデル(HMM)は、個々の部分列予測結果を一貫性があり正確な子音素系列に効果的に統合できるか?
  • RQ5音声・視覚のタイミングオフセットと共鳴効果は、認識性能にどのような影響を及ぼすか?また、視覚的発話認識システムにおいてこれらを効果的に是正できるか?

主な発見

  • 提案された3次元DCTベースの手法は、テストセットにおいて子音素系列認識で20%の正確度を達成し、最も高い報告値であった先行研究より2%向上した。
  • 視声素系列認識では39%の正確度を達成し、先行研究より2%向上した。この向上は統計的に有意であり、p値は0.0072であった。
  • 本研究では、同一条件下で3次元特徴抽出が2次元特徴抽出を上回ることを確認した。これは、空間時間的文脈が認識性能を向上させることを示している。
  • 二音素の使用は認識正確度を顕著に向上させ、本研究は、それ以外は同一の手法を二音素あり・なしで比較した最初の研究であり、その有益性を証明した。
  • 本手法は、すべての可能な部分列からの特徴抽出と、カスタムHMMによる統合により、発話の開始時刻と持続時間が不明な問題に効果的に対処した。
  • 改善が見られたが、長時間の子音素や頻度の高い子音素にバイアスがかかる傾向があり、部分列の全探索処理のため実行時間が依然として高い。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。