[論文レビュー] Seeing What You Said: Talking Face Generation Guided by a Lip Reading Expert
この論文では、訓練中に不正確な唇の動きをペナルティ化するために唇読みエキスパートを統合することで、読み取りの明瞭さを向上させる、新しい会話顔生成モデルTalkLipを提案する。自己教師付き音声視覚表現学習を活用し、グローバルに文脈を捉えた音声トランスフォーマーを用いた対照的学習を導入することで、語誤り率(LRS2で38% WER)および正確性(LRWで27.8%)において最先端の性能を達成し、同期性と視覚的品質を維持したまま、従来手法を著しく上回る明瞭さを実現した。
Talking face generation, also known as speech-to-lip generation, reconstructs facial motions concerning lips given coherent speech input. The previous studies revealed the importance of lip-speech synchronization and visual quality. Despite much progress, they hardly focus on the content of lip movements i.e., the visual intelligibility of the spoken words, which is an important aspect of generation quality. To address the problem, we propose using a lip-reading expert to improve the intelligibility of the generated lip regions by penalizing the incorrect generation results. Moreover, to compensate for data scarcity, we train the lip-reading expert in an audio-visual self-supervised manner. With a lip-reading expert, we propose a novel contrastive learning to enhance lip-speech synchronization, and a transformer to encode audio synchronically with video, while considering global temporal dependency of audio. For evaluation, we propose a new strategy with two different lip-reading experts to measure intelligibility of the generated videos. Rigorous experiments show that our proposal is superior to other State-of-the-art (SOTA) methods, such as Wav2Lip, in reading intelligibility i.e., over 38% Word Error Rate (WER) on LRS2 dataset and 27.8% accuracy on LRW dataset. We also achieve the SOTA performance in lip-speech synchronization and comparable performances in visual quality.
研究の動機と目的
- 聴覚障害者にとって重要な読み取りの明瞭さに焦点を当てていない、音声駆動型会話顔生成における課題に対処すること。
- 唇読みエキスパートを用いた新しいクロスモodal対照的学習戦略を導入することで、唇と音声の同期性を向上させること。
- 唇読みエキスパートと同時に同期的に事前学習されたトランスフォーマー・エンコーダーを用いて、音声の長距離時系列依存性をモデル化すること。
- 2つの唇読みエキスパートを用いた新しい評価戦略を提案し、明瞭さを客観的に測定すること。
- 唇読みのデータ不足を補うために、AV-Hubertを用いた音声視覚自己教師付き学習でエキスパートを訓練すること。
提案手法
- 生成された顔映像のシーケンスを唇読みエキスパートがテキストに変換し、その変換誤りを損失関数として用いて、訓練中に不正確な唇の動きをペナルティ化する。
- 唇読みエキスパートは、大規模な手動アノテーションが不要な、自己教師付き音声視覚表現学習手法AV-Hubertを用いて事前学習される。
- 音声埋め込みと唇読みエンコーダーからの視覚的文脈特徴を一致させるために、対照的学習の目的関数を導入し、唇と音声の同期性を向上させる。
- トランスフォーマーに基づく音声エンコーダーを用いて、全発話全体にわたるグローバルな時系列依存性を捉え、発音レベルの表現と同期性を向上させる。
- 生成器は、唇読み損失、対照的損失、および標準的なGAN損失と知覚損失を組み合わせて訓練され、明瞭さ、同期性、視覚的品質のバランスを取る。
- 連続音声の語誤り率と孤立語の正確性を測定するために、2つの別個の唇読みエキスパートを用いた新しい評価プロトコルを提案する。
実験結果
リサーチクエスチョン
- RQ1唇読みエキスパートを監視信号として統合することで、生成された会話顔映像の読み取り明瞭さが向上するか?
- RQ2音声と視覚特徴の間で対照的学習を導入することで、会話顔生成における唇と音声の同期性が向上するか?
- RQ3グローバルに文脈を捉えた音声エンコーダーは、局所的または短時間のエンコーダーと比較して、発音レベルの表現と同期性を向上させられるか?
- RQ4自己教師付き事前学習により、唇読みのデータ不足を補うことは有効か?
- RQ5複数の唇読みエキスパートを用いた新しい評価戦略は、会話顔生成における明瞭さの信頼性と客観的なベンチマークを提供できるか?
主な発見
- TalkLipはLRS2データセットで38%の語誤り率を達成し、従来の最先端手法と比較して明瞭さの面で著しく優れている。
- LRWデータセットでは、孤立語認識で27.8%の正確性を達成し、既存のアプローチを上回る明瞭さを示した。
- 唇読み損失の導入により、LRS2では少なくとも26.5%、LRWでは少なくとも31.2%の明瞭さ向上が確認され、その有効性が裏付けられた。
- 対照的学習により、類似語(例:'Meeting' と 'Media')間の埋め込みの混同が軽減され、LRS2では少なくとも6.5% WER、LRWでは少なくとも3.39%の正確性向上が達成された。
- グローバルな音声トランスフォーマー・エンコーダーは、局所的エンコーダーを上回り、WERと正確性の両方を向上させた。これは、長距離時系列依存性をモデル化することの利点を確認した。
- 二重の唇読みエキスパートを用いた提案評価戦略は、明瞭さの信頼性と再現可能性を備えたベンチマークを提供し、コードは公開された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。