Skip to main content
QUICK REVIEW

[論文レビュー] Speaker-independent machine lip-reading with speaker-dependent viseme classifiers

Helen L. Bear, Stephen Cox|arXiv (Cornell University)|Jan 1, 2015
Speech and Audio Processing被引用数 6
ひとこと要約

本稿では、話者に依存しない機械的唇読み取りを、話者に依存するビズーム分類器を用いて提案する。視覚的発話単位(ビズーム)は、個々の話者による違いはあれども、話者間で大きく一貫していることが示された。話者固有のビズームマップを発音誤り行列から構築し、話者間でのテストを実施した結果、認識性能の低下は誤ったビズームマッピングによるものではなく、話者不一致のHMM学習によるものであることが判明した。これは、話者間で普遍的なビズームレパートリーが存在することを示唆している。

ABSTRACT

In machine lip-reading, which is identification of speech from visual-only information, there is evidence to show that visual speech is highly dependent upon the speaker [1]. Here, we use a phoneme-clustering method to form new phoneme-to-viseme maps for both individual and multiple speakers. We use these maps to examine how similarly speakers talk visually. We conclude that broadly speaking, speakers have the same repertoire of mouth gestures, where they differ is in the use of the gestures.

研究の動機と目的

  • 視覚のみの発話認識におけるビズームマッピングが、話者間で一般化可能かどうかを調査すること。
  • 話者間の唇読み取りにおける性能低下が、誤ったビズームマッピングによるものか、不一致の学習データによるものかを特定すること。
  • 話者に依存するビズーム分類器が、話者に依存しない認識を達成する有効性を評価すること。
  • 発音誤り行列を用いて、異なる話者間でのビズームマップの安定性と類似性を評価すること。

提案手法

  • 話者固有の発音認識結果から得られる発音誤り行列を基に、話者に依存するビズームマップを構築する。
  • 発音がお互いに誤りやすい場合に限り、子音と母音を別々にビズームにクラスタリングする。
  • 交差検証を用いて、3状態モデルと5つのガウス成分を用いた隠れマルコフモデル(HMM)の学習とテストを実施する。
  • システムはAAMで抽出した唇特徴量と、HTKツールキットを用いてHMMの学習・再推定・認識を実行する。
  • 性能評価は、AVLetters2データセットにおける語正答率を用い、同一話者、異なる話者、複数話者設定の間で比較する。
  • 重み付きスコアリングシステムを用いて、同一話者ベースラインを基準にビズームマップの性能を評価し、統計的有意性を考慮する。

実験結果

リサーチクエスチョン

  • RQ1話者に依存するビズームマップを、話者に依存しない唇読み取りに効果的に再利用できるか?
  • RQ2話者間の唇読み取りにおける性能低下は、誤ったビズームマッピングによるものか、不一致の学習データによるものか?
  • RQ3視覚的発話認識において、異なる話者間でのビズームマッピングはどれほど類似しているか?
  • RQ4視覚的発話が話者間で共通して表現できる普遍的なビズームの集合が存在するのか、それとも話者固有のものなのか?

主な発見

  • ある話者のデータで学習した話者に依存するビズームマップを、別の話者のデータに適用した場合、認識性能が著しく低下するが、HMMの再学習によりこの低下が解消される。これは、問題がビズームマップそのものにあるのではなく、不一致の話者データによるHMM学習にあることを示している。
  • 同じビズームマップ(例:M1234)が複数の話者で一貫して高い性能を示すため、個々の話者間で共通のビズームレパートリーが存在することが示唆される。
  • 話者に依存する性能が最も高かった話者3は、話者に依存しないマップ(M124)でも最高の結果を達成した。これは、固有の視覚的発話パターンが話者間の類似性を低下させる可能性があることを示している。
  • ビズームマップに含まれるビズーム数は認識性能と相関しており、少ない数で明確に区別できるビズームを含むマップは、特にビズーム同音異義語の影響が少ない場合、より優れた性能を示す。
  • 話者4において、/ow/と/uw/を/v01/ビズームに追加したことで、話者1と比較して性能が著しく低下した。これは、わずかなマッピングの違いで認識性能に影響を与える可能性があることを示している。
  • 本研究の結論として、視覚的発話単位(ビズーム)は本質的に話者に依存しないレパートリーを有しているが、使用頻度は異なる。これは、音声発話における母音の違いが話者間で共有されるのと同様である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。