Skip to main content
QUICK REVIEW

[論文レビュー] Large-scale multilingual audio visual dubbing

Yi Yang, Brendan Shillingford|arXiv (Cornell University)|Nov 6, 2020
Music and Audio Processing参考文献 38被引用数 12
ひとこと要約

本論文では、動画コンテンツを翻訳された音声と同期する口元の動きに合成することで、複数言語へのオーディオビジュアルダビングを大規模に実現するシステムを提示する。スティーブラー特化データでファインチューニングされた多言語・マルチスプリーカーのリップシンクモデルを用いることで、自然な音声と高精度なオーディオビジュアル同期を達成し、言語の壁を超えて教育的コンテンツの関与度とアクセシビリティを著しく向上させる。

ABSTRACT

We describe a system for large-scale audiovisual translation and dubbing, which translates videos from one language to another. The source language's speech content is transcribed to text, translated, and automatically synthesized into target language speech using the original speaker's voice. The visual content is translated by synthesizing lip movements for the speaker to match the translated audio, creating a seamless audiovisual experience in the target language. The audio and visual translation subsystems each contain a large-scale generic synthesis model trained on thousands of hours of data in the corresponding domain. These generic models are fine-tuned to a specific speaker before translation, either using an auxiliary corpus of data from the target speaker, or using the video to be translated itself as the input to the fine-tuning process. This report gives an architectural overview of the full system, as well as an in-depth discussion of the video dubbing component. The role of the audio and text components in relation to the full system is outlined, but their design is not discussed in detail. Translated and dubbed demo videos generated using our system can be viewed at https://www.youtube.com/playlist?list=PLSi232j2ZA6_1Exhof5vndzyfbxAhhEs5

研究の動機と目的

  • オンライン教育における言語的障壁を解消し、教育動画を複数の言語に大規模に翻訳すること。
  • 自然な口元の動きを保ったオーディオビジュアルダビングにサブタイトルを置き換えることで、視聴者の関与度を向上させること。
  • 翻訳された音声と現実的でスプリーカー特化の口元の動きをシームレスに同期するシステムを開発すること。
  • 最小限のスプリーカー特化データでのファインチューニングを活用し、スケーラブルで自動化されたダビングを実現すること。
  • 高品質な知覚的品質で複数言語に翻訳可能な教育的コンテンツへのアクセスを民主化すること。

提案手法

  • 20言語で合計3,700時間にわたる大規模な多言語ビジュアルスピーチデータセットを収集し、マルチスプリーカーのリップシンクモデルの事前学習に使用する。
  • リップシンクモデルは、ビデオフレーム、リファレンスフレーム、音声埋め込みの3つの独立したエンコーダーと、口元領域のフレームを生成するデコーダーを備えた残差U-Netである。
  • スプリーカー特化のファインチューニングは、少量の補助的スプリーカー特化データまたはターゲット動画そのものを入力として行う。
  • 音声翻訳は、数千時間にわたるデータで事前学習され、スプリーカーごとにファインチューニングされたスプリーカー適応型テキストトゥースピーチ(TTS)モデルで処理される。
  • 翻訳音声の長さを元の動画と一致させるために速度調整を行い、その後リップシンクモデルを適用して同期された顔面フレームを生成する。
  • 最終的な動画出力では、画像処理を用いて予測された口元フレームと元の動画をブレンドし、アイデンティティと照明の一貫性を維持する。

実験結果

リサーチクエスチョン

  • RQ11つの大規模なリップシンクモデルが、複数の言語とスプリーカーに一般化しつつ、翻訳音声と高い同期性を維持できるか?
  • RQ2少量のデータ(例:数分間の動画)を用いたスプリーカー特化のファインチューニングは、口元の動きのリアリズムと同期性を向上させるのにどの程度有効か?
  • RQ3事前学習済み多言語モデルとスプリーカー特化の適応を組み合わせた場合、知覚的な自然さとオーディオビジュアル同期にどのような影響を与えるか?
  • RQ4非ネイティブスピークァーにおいて、システムはサブタイトルと比較して視聴者の関与度、空間的没入感、理解度にどの程度優れているか?
  • RQ5オーディオビジュアル翻訳の過程で、元のスプリーカーのアイデンティティと視覚的特徴をどの程度維持できるか?

主な発見

  • 事前学習済み重みとスプリーカー特化データの両方でファインチューニングしたモデルが、自然さ(3.04 ± 0.07)と同期性(2.12 ± 0.05)の両面で最高の平均評価スコア(MOS)を達成した。
  • ファインチューニングのみでは画像品質は向上したが、オーディオビジュアル同期性が劣化したため、事前学習を基盤とすることが不可欠であることが示された。
  • 事前学習のみのモデルは、自然さ(2.35 ± 0.07)と同期性(1.93 ± 0.04)の両方で低いスコアを記録し、スプリーカー適応の恩恵が顕著に現れた。
  • 多様な言語にわたり優れたパフォーマンスを発揮し、多言語モデルは多言語テストセットにおいて同期性のMOSが78.5を達成した。
  • 主観的評価により、事前学習とファインチューニングの組み合わせが、自然さとリップシンクの正確性の両面で、単独でのアプローチを著しく上回ることが確認された。
  • 本システムは、顕著な透かしと同意済みコンテンツを含む合成動画を効果的に生成し、悪用のリスクを最小限に抑えつつ教育的アクセシビリティを実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。