Skip to main content
QUICK REVIEW

[論文レビュー] Fre-GAN: Adversarial Frequency-consistent Audio Synthesis

Ji-Hoon Kim, Sanghoon Lee|arXiv (Cornell University)|Jun 4, 2021
Music and Audio Processing参考文献 32被引用数 7
ひとこと要約

Fre-GAN は、分解能接続型生成器と分解能別判別器を用いた周波数整合性のある神経音声生成器を提案する。離散ウェーブレット変換(DWT)を用いた損失なしダウンサンプリングを実装し、人間水準に近い音声品質を達成。実音声とのMOS差は0.03にとどまり、既存のGANベース音声生成器を上回る忠実度とスペクトル整合性を実現。

ABSTRACT

Although recent works on neural vocoder have improved the quality of synthesized audio, there still exists a gap between generated and ground-truth audio in frequency space. This difference leads to spectral artifacts such as hissing noise or reverberation, and thus degrades the sample quality. In this paper, we propose Fre-GAN which achieves frequency-consistent audio synthesis with highly improved generation quality. Specifically, we first present resolution-connected generator and resolution-wise discriminators, which help learn various scales of spectral distributions over multiple frequency bands. Additionally, to reproduce high-frequency components accurately, we leverage discrete wavelet transform in the discriminators. From our experiments, Fre-GAN achieves high-fidelity waveform generation with a gap of only 0.03 MOS compared to ground-truth audio while outperforming standard models in quality.

研究の動機と目的

  • 生成音声と実音声の周波数領域における不整合が原因で生じる、ヒスティングやリバーブなどのスペクトルアーティファクトを是正する。
  • 波形生成中に複数の周波数帯域で一貫したスペクトル分布を保証することで、音声忠実度を向上させる。
  • 段階的学習と分解能別判別器を用いることで、敵対的訓練の安定化を図る。
  • 従来の平均プーリングに代えて離散ウェーブレット変換(DWT)を採用し、ダウンサンプリング時に高周波成分を保持する。
  • MOS、MCD、FDSD などの主観的および客観的指標において、最先端の性能を示すことを実証する。

提案手法

  • 最近傍補間とスキップ接続を用いて、複数の分解能層からの波形をアップサンプリングし、合算する分解能接続型生成器(RCG)を採用する。
  • DWT を用いて音声をダウンサンプリングし、複数のスケールで生成波形を評価する分解能別判別器(RPD および RSD)を導入し、マルチスケールでのスペクトル整合性を確保する。
  • DWT を判別器のダウンサンプリング手法として統合し、その双直交性とエネルギー保存性により、高周波成分の保持を実現する。
  • 各分解能層で入力メルスペクトログラムを条件として与えることで、スケール間での周波数整合性を保証する。
  • RCG に対して段階的学習を適用し、低分解能出力から始め、徐々に高分解能部品を追加することで訓練の安定化を図る。
  • 判別器にマルチペリオド判別器(MPD)とマルチスケール判別器(MSD)のコンponentsを統合し、周期的パターンと長期的依存関係を捉える。

実験結果

リサーチクエスチョン

  • RQ1ダウンサンプリング時に高周波成分を保持することで、周波数整合性のある音声合成を実現するGANベース音声生成器は可能か?
  • RQ2平均プーリングを離散ウェーブレット変換(DWT)に置き換えると、神経音声生成におけるスペクトル忠実度と知覚的品質にどのような影響を与えるか?
  • RQ3分解能接続型生成器(RCG)は、マルチスケールスペクトル学習と訓練安定性をどの程度向上させるか?
  • RQ4RCG、DWT、MPD/MSD、メルスペクトログラム条件付けといった各アーキテクチャ的要素が、全体の音声品質に果たす寄与度はいかほどか?
  • RQ5提案手法は、MOSで測定した場合、実音声に近い完璧に近い知覚的品質を達成できるか?

主な発見

  • Fre-GAN は主観的MOSが 4.25 ± 0.04 を達成し、実音声(4.39 ± 0.03)との差がわずか 0.03 にとどまり、人間水準に近い知覚的品質を示した。
  • MOS と客観的指標の両面で、HiFi-GAN V2(MOS: 4.08 ± 0.05)および WaveNet を上回り、MCD 13 は 1.383、FDSD は 0.209 を記録した。
  • DWT を平均プーリング(AP)に置き換えると、MOS は 4.12 ± 0.05 に低下し、MCD 13 は 1.592 に上昇するなど、DWT が高周波成分の保持に果たす重要性が明確に示された。
  • アブレーションスタディの結果、RCG アーキテクチャを削除すると MCD 13 は 1.602 まで悪化し、マルチスケールスペクトル学習におけるその重要性が裏付けられた。
  • RCG を用いた段階的学習により、訓練が安定化し、時間経過とともに低分解能から高分解能へ注目がシフトした。DWT により高周波成分が保持された。
  • メルスペクトログラム差分の可視化分析(図3)から、Fre-GAN は実音声と比較して最小限のピixe-wise誤差を示し、周波数整合性のある音声を生成していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。