Skip to main content
QUICK REVIEW

[論文レビュー] Finding phonemes: improving machine lip-reading

Helen L. Bear, Richard Harvey|arXiv (Cornell University)|Oct 3, 2017
Speech and Audio Processing参考文献 7被引用数 5
ひとこと要約

本稿は、音声認識からの誤り行列を用いて、話者固有の最適なビズム単位をデータ駆動で導出する手法を提案する。LiLIRデータセットとHMMベースの分類を用いて、単語認識性能が、従来のビズム集合よりも音素レベル分類器の方が優れていること、また音素とビズムの中間的な単位が最良の結果をもたらすことを示している。これは、ビズムが最適であるという従来の常識に挑戦するものである。

ABSTRACT

In machine lip-reading there is continued debate and research around the correct classes to be used for recognition. In this paper we use a structured approach for devising speaker-dependent viseme classes, which enables the creation of a set of phoneme-to-viseme maps where each has a different quantity of visemes ranging from two to 45. Viseme classes are based upon the mapping of articulated phonemes, which have been confused during phoneme recognition, into viseme groups. Using these maps, with the LiLIR dataset, we show the effect of changing the viseme map size in speaker-dependent machine lip-reading, measured by word recognition correctness and so demonstrate that word recognition with phoneme classifiers is not just possible, but often better than word recognition with viseme classifiers. Furthermore, there are intermediate units between visemes and phonemes which are better still.

研究の動機と目的

  • ビズムベースの分類が、視覚のみの音声認識において最適であるかどうか、あるいは音素とビズムの中間的な単位がより優れた性能を示すかを調査すること。
  • 話者に依存する一貫性のある方法を用いて、音素誤りデータからカスタムビズムマップを生成し、異なるビズム集合サイズ間での制御された比較を可能にすること。
  • 2〜45ビズムの異なる数の視覚的単位に対して、単語認識の正確性を評価し、各話者ごとに最適なビズムクラスの数と構造を特定すること。
  • ビズムが最良の中間表現であるという従来の仮定に反して、音素レベルとビズムレベルの分類器との定量的比較を通じて、それを挑戦すること。

提案手法

  • 本手法は、話者固有の音声認識を10分割交差検証とHTKベースのHMMを用いて行い、各話者あたり200発話からなる誤り行列を生成する。
  • 誤り行列を列正規化して、条件付き確率 Pr{p_i | p̂_j} を得る。これは、真の音素 p_i が誤って p̂_j と分類された確率を表す。
  • 貪欲なクラスタリングアルゴリズムにより、最も混同されやすい2つの音素(q = Pr{p_r|p̂_s} + Pr{p_s|p̂_r} が最大となるもの)を組み合わせ、新しいビズムクラスを形成する。このプロセスを2つのクラスが残るまで繰り返す。
  • 母音と子音を別々にクラスタリングすることで、発音的差異を保ち、ビズムグループが発音的に整合性を持つようにする。
  • 45から2つのビズムまでの中間のクラスタリング段階ごとに、新しいビズムマップが生成され、その後、HMMベースの単語認識モデルを再学習するために使用される。
  • 性能は、訓練データの分散に合わせて正規化された単語認識の正答率で測定され、異なるビズム集合サイズの影響を比較する。

実験結果

リサーチクエスチョン

  • RQ1口唇読みにおいて、音素レベル分類が従来のビズムベース分類を上回るのか?
  • RQ2音素とビズムの中間的な最適な視覚的単位の数が、単語認識正確性を最大化するのか?
  • RQ3一般的に用いられるビズム集合(例:Leeセット、Jeffersセット)は、個々の話者にとって最良の構成であるのか?
  • RQ4ビズム集合サイズが変化するに従い、同音語の数と各単位の訓練データ不足が認識性能に与える影響は何か?
  • RQ5誤り行列から導出される話者固有のビズムマップは、固定された全話者に共通のビズム定義を上回る性能を示すのか?

主な発見

  • LiLIRデータセットに含まれる12人の全話者において、音素レベル分類器を用いた単語認識性能は、ビズムレベル分類器を著しく上回っている。
  • 各話者にとっての最適な視覚的単位の数は、8から音素数の範囲にあり、一般的なビズム集合(例:10〜20ビズム)とは一貫して一致しない。
  • 性能曲線は非単調的である:10ビズム未満では同音語の増加により正答率が急激に低下し、ビズム数が多い場合もデータの疎らさと視覚的明確性の低さにより正答率が低下する。
  • 12人の話者のうち3人の最適なビズム集合サイズは10〜20の範囲にあったが、これは統計的に有意な優位性はなく、ランダムな結果と差がないことから、普遍的な最適サイズは存在しないことが示唆された。
  • 最も優れた性能を示したビズムマップは話者固有であり、話者間で一貫したパターンはなく、全話者に共通するビズム集合が最適である可能性は低いことが示された。
  • 特定のビズムクラスの統合(例:SP01における/s/と/r/の統合)が顕著に認識性能を向上させることを確認し、最適なビズムグループ化が非常に個人差に依存することを裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。