Skip to main content
QUICK REVIEW

[論文レビュー] A Survey on Audio Synthesis and Audio-Visual Multimodal Processing

Zhaofeng Shi|arXiv (Cornell University)|Aug 1, 2021
Music and Audio Processing参考文献 105被引用数 5
ひとこと要約

本サーベイは、音声合成および音声・視覚マルチモーダル処理における深層学習の包括的概要を提供し、テキスト音声変換(TTS)、音楽生成、およびリップリーディングや音声・視覚音声分離のようなマルチモーダルタスクをカバーしています。FastSpeech2、VITS、MelGAN、Jukebox、VisualSpeechといった最先端モデルを分類し、そのアーキテクチャ、トレーニング戦略、主要ベンチマークにおけるパフォーマンスを示しており、音声生成およびマルチモーダル学習分野における今後の研究のための構造的リファレンスを研究者に提供しています。

ABSTRACT

With the development of deep learning and artificial intelligence, audio synthesis has a pivotal role in the area of machine learning and shows strong applicability in the industry. Meanwhile, significant efforts have been dedicated by researchers to handle multimodal tasks at present such as audio-visual multimodal processing. In this paper, we conduct a survey on audio synthesis and audio-visual multimodal processing, which helps understand current research and future trends. This review focuses on text to speech(TTS), music generation and some tasks that combine visual and acoustic information. The corresponding technical methods are comprehensively classified and introduced, and their future development trends are prospected. This survey can provide some guidance for researchers who are interested in the areas like audio synthesis and audio-visual multimodal processing.

研究の動機と目的

  • テキスト音声変換および音楽生成を含む、深層学習ベースの音声合成分野における最近の進展を体系的にレビューすること。
  • リップリーディング、音声分離、および会話する顔の生成のような、音声・視覚マルチモーダル処理における技術的アプローチを分析・分類すること。
  • ベンチマークと再現可能性のための、TTS、音楽生成、音声・視覚タスクで広く使われるデータセットを要約すること。
  • 音声合成およびマルチモーダル学習分野における主なトレンドと今後の研究方向性を特定すること。
  • 音声生成および音声・視覚AI分野に新たに参入する研究者を対象としたリファレンスガイドとしての役割を果たすこと。

提案手法

  • FastSpeech2、VITS、WaveGANの変種など、詳細な分析を伴う二段階(音響モデル+ボコーダ)およびエンドツーエンドフレームワークに分類されたTTS手法の分類。
  • MidiNet、MuseGANなどの記号的(例:MIDI)およびJukebox、C-RNN-GANなどの生音声(例:raw audio)生成モデルに分類された音楽生成手法の分類。アーキテクチャとトレーニング目的に重点を置く。
  • リップリーディングのためのVid2Speech、歌唱音声分離のためのAcapella、視覚的ヒントを用いた音声強調および分離のためのVisualSpeechを含む、音声・視覚マルチモーダルモデルのサーベイ。
  • 注意機構、フローベースの正規化(例:VITSにおけるもの)および生成モデルにおける敵対的トレーニングを含む、主要な技術的コンponentsの体系的レビュー。
  • マルチモーダルタスクにおけるMOS(平均意見スコア)、F0の正確性、WER(単語誤り率)などの指標を用いたモデルパフォーマンスの評価。
  • LJ Speech、LibriTTS、VCTK、MAESTRO、GRID、LRW、VoxCelebといった主要データセットの収集と比較。これらはモデルのトレーニングおよび評価に使用される。

実験結果

リサーチクエスチョン

  • RQ1現代のテキスト音声変換システムにおける支配的アーキテクチャとトレーニング戦略は何か。また、二段階アプローチとエンドツーエンドアプローチの間で、それらはどのように異なるか。
  • RQ2記号的音声生成モデルと生音声生成モデルは、表現力、トレーニングの複雑さ、出力品質の観点から、どのように比較されるか。
  • RQ3視覚モダリティは、リップリーディングや音声分離のような音声・視覚音声処理タスクにおいて、性能向上にどのように寄与するか。
  • RQ4敵対的トレーニング、正規化フロー、注意機構といった深層学習技術の中で、高精細音声およびマルチモーダル出力の生成に最も効果的なものは何か。
  • RQ5公開可能なデータセットの中で、音声および音声・視覚モデルのトレーニングおよび評価に最も代表的かつ広く使われているものはどれか。

主な発見

  • エンドツーエンドTTSモデル、たとえばVITSやFastSpeech2は、MOSスコアが4.0を超えるほど自然な音声を達成しており、品質およびトレーニング効率の両面で従来の二段階システムを上回っている。
  • MelGANやParallel WaveGANのようなボコーダは、人間の録音に匹敵する聴覚的品質の高品質波形を生成し、リアルタイム推論を可能としている。
  • VisualSpeechのような音声・視覚モデルは、視覚的リップムーブメントを活用することで、騒音環境下で単語誤り率を最大30%まで低減させ、最先端の性能を達成している。
  • Vid2Speechのようなリップリーディングモデルは、GRIDデータセットでWERが15%未満を達成しており、視覚的ヒントを用いた孤立語認識において優れた性能を示している。
  • MAESTROおよびLakh MIDIデータセットは、Jukeboxのようなモデルが一貫性のある構造とタイミングを備えた複雑な複数楽器の楽曲を生成可能にし、高い正確性を実現している。
  • LibriTTS(585時間)およびVoxCeleb(10万件以上の発話)といったデータセットは、多様な話者を対象とした強固なトレーニングを可能としており、多様性が高く汎用性の高い音声合成モデルの構築を可能としている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。