Skip to main content
QUICK REVIEW

[論文レビュー] Deep Learning for Lip Reading using Audio-Visual Information for Urdu Language

Faisal Muhammad, Sanaullah Manzoor|arXiv (Cornell University)|Feb 15, 2018
Speech and Audio Processing参考文献 9被引用数 15
ひとこと要約

本稿では、時間的空間的畳み込みニューラルネットワーク(ST-CNN)とバイゲートドRNN、および接続主義的時系列分類(CTC)損失を用いた音声・視覚モダリティの統合により、ウルドゥー語の唇読みのためのマルチモーダル深層学習フレームワークを提案する。独自の音声・視覚データセットを構築し、音声・視覚の統合モデリングにより騒音環境下での語りかけ認識性能を向上させ、単一モダリティのベースラインよりも高い精度を達成した。

ABSTRACT

Human lip-reading is a challenging task. It requires not only knowledge of underlying language but also visual clues to predict spoken words. Experts need certain level of experience and understanding of visual expressions learning to decode spoken words. Now-a-days, with the help of deep learning it is possible to translate lip sequences into meaningful words. The speech recognition in the noisy environments can be increased with the visual information [1]. To demonstrate this, in this project, we have tried to train two different deep-learning models for lip-reading: first one for video sequences using spatiotemporal convolution neural network, Bi-gated recurrent neural network and Connectionist Temporal Classification Loss, and second for audio that inputs the MFCC features to a layer of LSTM cells and output the sequence. We have also collected a small audio-visual dataset to train and test our model. Our target is to integrate our both models to improve the speech recognition in the noisy environment

研究の動機と目的

  • 騒音環境下での語りかけ認識精度の低さに取り組むために、視覚的唇の動きを活用する。
  • 音声と視覚情報を統合するマルチモーダル深層学習システムを構築し、ウルドゥー語の語りかけ認識を向上させる。
  • 低リソース言語の研究を支援するため、ウルドゥー語の唇読み用に新しい音声・視覚データセットを収集・公開する。
  • 系列変換タスクにおける単一モダリティ(音声のみ、映像のみ)とマルチモーダル(音声・視覚統合)モデルの性能を比較する。
  • 時間的空間的畳み込み層およびゲート付き再帰層が、唇の動きの時間的ダイナミクスをモデル化する上でどの程度有効であるかを評価する。

提案手法

  • 時間的空間的畳み込みニューラルネットワーク(ST-CNN)を用いて、唇の動きの映像シーケンスから空間的・時間的特徴を抽出する。
  • バイゲートド再帰ニューラルネットワーク(Bi-GRU)を用いて、抽出された特徴を処理し、系列的唇の動きにおける長距離依存性をモデル化する。
  • 入力と出力のシーケンスを強制的アライメントなしに、エンドツーエンドで学習可能とするために、接続主義的時系列分類(CTC)損失を適用する。
  • 音声モダリティの場合は、MFCC特徴量をLSTMセルのスタックに供給し、時間的音響パターンをモデル化する。
  • 音声および映像モデルを別々に学習し、その後統合することで、騒音環境下での耐性を高める。
  • ウルドゥー語の音声・視覚データセットを収集し、学習および評価に使用する。

実験結果

リサーチクエスチョン

  • RQ1騒音環境下でのウルドゥー語の語りかけ認識性能は、音声・視覚統合によって向上するか?
  • RQ2単一モダリティの音声モデルと映像モデルは、精度および耐性の観点でどのように比較されるか?
  • RQ3時間的空間的CNNとBi-GRUの統合は、唇読みの系列モデリングをどの程度向上させるか?
  • RQ4CTC損失の使用により、強制的アライメントなしに唇読みモデルのエンドツーエンド学習が有効に可能になるか?
  • RQ5本稿で提案するマルチモーダルシステムは、ウルドゥー語のような低リソース言語においてどの程度効果的か?

主な発見

  • マルチモーダルな音声・視覚統合モデルは、単一モダリティの音声のみおよび映像のみのモデルを上回る語りかけ認識精度を達成した。
  • CTC損失の使用により、フレームレベルの明示的アライメントを必要とせず、唇読みモデルのエンドツーエンド学習が可能になった。
  • 時間的空間的CNNは、映像シーケンス全体における唇の動きの空間的および時間的パターンを効果的に捉えた。
  • バイゲートドRNNアーキテクチャは、視覚シーケンスにおける長距離依存性を捉えることで、系列モデリングを向上させた。
  • 独自に収集した音声・視覚データセットは、低リソース言語のウルドゥー語の唇読み研究における貴重なベンチマークを提供した。
  • 音声と視覚の統合により、騒音環境下での耐性が顕著に向上し、マルチモーダル学習の利点が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。