Skip to main content
QUICK REVIEW

[論文レビュー] Learning Individual Speaking Styles for Accurate Lip to Speech Synthesis

K R Prajwal, Rudrabha Mukhopadhyay|arXiv (Cornell University)|May 17, 2020
Speech and Audio Processing参考文献 41被引用数 10
ひとこと要約

この論文では、制約のない大規模語彙の唇映像から個々の発話スタイルを学習し、正確で自然な音声を合成する、sequence-to-sequenceモデルLip2Wavを提案する。先行研究と比較して、120時間のスケールで話者固有のデータセット(1人あたり80倍のデータ量、100倍の語彙規模)を活用することで、制約のない環境下で4倍高い音声理解度を達成した。

ABSTRACT

Humans involuntarily tend to infer parts of the conversation from lip movements when the speech is absent or corrupted by external noise. In this work, we explore the task of lip to speech synthesis, i.e., learning to generate natural speech given only the lip movements of a speaker. Acknowledging the importance of contextual and speaker-specific cues for accurate lip-reading, we take a different path from existing works. We focus on learning accurate lip sequences to speech mappings for individual speakers in unconstrained, large vocabulary settings. To this end, we collect and release a large-scale benchmark dataset, the first of its kind, specifically to train and evaluate the single-speaker lip to speech task in natural settings. We propose a novel approach with key design choices to achieve accurate, natural lip to speech synthesis in such unconstrained scenarios for the first time. Extensive evaluation using quantitative, qualitative metrics and human evaluation shows that our method is four times more intelligible than previous works in this space. Please check out our demo video for a quick overview of the paper, method, and qualitative results. https://www.youtube.com/watch?v=HziA-jmlk_4&feature=youtu.be

研究の動機と目的

  • 制約のない大規模語彙設定において、マルチスケーラーまたは制約付き設定ではなく、個々の話者に焦点を当てた正確な唇から音声への変換の課題を解決すること。
  • 唇の形が似ているが聴覚的に異なる音素(同音異義音素)の曖昧性を、話者固有の特徴と文脈的音声視覚的手がかりをモデル化することで克服すること。
  • 120時間の自然で制約のない発話を1人あたり記録した大規模な公開ベンチマークデータセット(Lip2Wav)を収集・公開し、堅牢な単一話者向け唇から音声へのモデリングを可能にすること。
  • 1人の話者を長時間観測することで、静止した唇映像からプロソディックで理解可能な音声を生成するsequence-to-sequenceモデルを開発すること。
  • 長期間の視覚的文脈モデリングによって話者固有のダイナミクスをモデル化することで、音声合成の質と理解度が顕著に向上することを示すこと。

提案手法

  • 3D-CNNに基づく視覚エンコーダーが動画フレームからの空間的・時間的唇の動きを処理するsequence-to-sequenceアーキテクチャを採用し、空間的および時間的特徴を捉える。
  • 同音異義音素の区別を向上させるために、3秒の文脈窓(先行研究の約6倍の長さ)を用い、文脈的共起パターンを活用する。
  • Transformerベースのデコーダーが、自己注意メカニズムを介して視覚特徴と関連する唇フレームに注目しながら、音声を自己回帰的に生成する。
  • 訓練中に教師強制(teacher forcing)を徐々に減衰させる(約30,000イテレーションから開始)ことで、汎化性能を向上させ、訓練語彙への過学習を軽減する。
  • 活性化マップと注目度アライメント曲線により、視覚エンコーダーが口元領域に強く注目していることが確認された。
  • 2D-CNN、2D+1D-CNN、3D-CNNの異なる視覚エンコーダーを評価した結果、3D-CNNが空間的・時間的ダイナミクスを捉える上で優れた性能を示した。

実験結果

リサーチクエスチョン

  • RQ1手動アノテーションなしで、唇の動きの長期的観測からのみ、正確で話者固有の音声パターンをデータ駆動型モデルが学習できるか?
  • RQ2唇の動きの文脈窓を拡大することで、唇から音声への変換における同音異義音素の区別にどのような影響を与えるか?
  • RQ3徐々に教師強制を減衰させることで、未学習語彙に対する汎化性能と性能がどの程度向上するか?
  • RQ4異なる視覚エンコーダーのアーキテクチャ(2D-CNN、2D+1D-CNN、3D-CNN)は、唇映像からの正確な音声合成にどの程度空間的・時間的特徴を捉えられるか?
  • RQ5大規模で制約のない単一話者データセットで訓練されたsequence-to-sequenceモデルは、先行のマルチスケーラーまたは小規模語彙アプローチと比較して、顕著に高い理解度と自然さを達成できるか?

主な発見

  • 提案されたLip2Wavモデルは、未学習テストセットにおいてSTOI(0.446)、ESTOI(0.311)、PESQ(1.290)のスコアを達成し、先行手法と比較して4倍高い音声理解度を示した。
  • 3秒の文脈窓を用いることで、短い窓(0.5秒および1.5秒)と比較して性能が顕著に向上し、STOIが0.264から0.446に上昇した。これは長距離文脈の利点を示している。
  • 徐々に教師強制を減衰させることで、モデルの汎化性能が向上し、STOIが常に強制された場合の0.221から0.446に上昇した。これは、訓練語彙への過学習が軽減されたことを示している。
  • 3D-CNN視覚エンコーダーは2D-CNNおよび2D+1D-CNNの変種を上回り、最高のSTOI(0.446)、ESTOI(0.311)、PESQ(1.290)スコアを達成した。
  • 人間評価により、生成された音声が先行研究と比較してより自然でプロソディックであることが確認され、制約のない環境下での理解度が向上した。
  • 注目度可視化により、モデルが口元に強く注目しており、デコーダー出力が対応する唇フレームとアライメントしていることが確認され、関連する視覚的手がかりに焦点を当てていることが検証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。