[論文レビュー] QuickVC: Any-to-many Voice Conversion Using Inverse Short-time Fourier Transform for Faster Conversion
QuickVC は、発話者に依存しないコンテンツ特徴抽出のための HuBERT-Soft を活用し、VITS の計算コストの高い音声生成器を iSTFT ベースのデコーダーで置き換えることで、軽量でエンドツーエンドの音声変換モデルを提案する。RTX 3090 GPU 上で 5000 KHz を超える推論速度(5320.78 KHz)を達成し、i9-10900K CPU 上でも 280 KHz の高速推論を実現した。同時に、高い音声自然性(N-MOS: 4.28)と類似性(S-MOS: 3.58)を維持している。
With the development of automatic speech recognition (ASR) and text-to-speech (TTS) technology, high-quality voice conversion (VC) can be achieved by extracting source content information and target speaker information to reconstruct waveforms. However, current methods still require improvement in terms of inference speed. In this study, we propose a lightweight VITS-based VC model that uses the HuBERT-Soft model to extract content information features without speaker information. Through subjective and objective experiments on synthesized speech, the proposed model demonstrates competitive results in terms of naturalness and similarity. Importantly, unlike the original VITS model, we use the inverse short-time Fourier transform (iSTFT) to replace the most computationally expensive part. Experimental results show that our model can generate samples at over 5000 kHz on the 3090 GPU and over 250 kHz on the i9-10900K CPU, achieving competitive speed for the same hardware configuration.
研究の動機と目的
- 高速な推論速度を備えたリアルタイムで高品質な音声変換モデルの不足を補う。
- 音声自然性と発話者類似性を損なわずに推論速度を向上させる。
- VITS デコーダーの計算の冗長性を低減することで、デバイス内での実装を可能にする。
- 自己教師付き音声表現(HuBERT-Soft)を活用し、発話者IDに依存しないコンテンツ特徴を抽出する。
- 最小限の遅延でエンドツーエンドの非自己回帰的推論を実現するように、VITS を最適化する。
提案手法
- 高品質な波形合成のための敵対的学習とノーマライジングフローを活用する VITS をバックボーンとして採用し、エンドツーエンドの音声変換を実現する。
- VITS の元々の Hifi-GAN ボコーダーを逆短時間フーリエ変換(iSTFT)デコーダーに置き換えることで、計算コストを低減する。
- 生波形から発話者に依存しないコンテンツ特徴を抽出するために HuBERT-Soft を使用し、テキストアノテーションの必要性を排除する。
- iSTFT デコーダーにマルチバンド並列戦略を導入することで、波形再構成を高速化し、冗長性を低減する。
- 訓練時にデータ拡張を適用することで、コンテンツ特徴の分離性を向上させ、音声自然性と類似性を改善する。
- 複数発話者向け音声変換を可能にするために、発話者エンコーダーを訓練し、発話者埋め込みを抽出する。
実験結果
リサーチクエスチョン
- RQ1VITS をベースにした音声変換モデルは、高品質な聴取品質を維持しながら、高速な推論速度を達成できるか?
- RQ2iSTFT ベースのデコーダーは、Hifi-GAN ボコーダーの置き換えとして、より高速な波形生成にどの程度効果的か?
- RQ3コンテンツ特徴抽出に HuBERT-Soft を使用することで、音声変換における分離性と一般化性能がどの程度向上するか?
- RQ4訓練時にデータ拡張を適用することで、モデルの言語的コンテンツと発話者アイデンティティの保持能力が向上するか?
- RQ5提案手法は、消費用途のハードウェア(CPU/GPU)上でリアルタイム推論を実現できるか、品質を損なわず?
主な発見
- QuickVC-sr は、すべてのモデルの中で最高の自然性スコア(N-MOS: 4.28 ± 0.15)を達成し、Diff-VCTK(3.46 ± 0.21)や BNE-PPG-VC(3.83 ± 0.17)を上回った。
- QuickVC-sr は、最高の発話者類似性(S-MOS: 3.58 ± 0.20)と Resemblyzer スコア(85.68%)を達成し、すべてのベースラインを上回った。
- LibriSpeech では、語誤り率(WER)が 2.43%、文字誤り率(CER)が 0.86% であり、言語的コンテンツの保持が良好であることが示された。
- RTX 3090 GPU 上では、QuickVC は 5320.78 KHz の推論速度を達成し、Diff-VCTK(63.34 KHz)や VQMIVC(148.27 KHz)を大きく上回った。
- i9-10900K CPU 上では、QuickVC は 280.00 KHz の推論速度を達成し、すべてのベースラインを上回り、リアルタイムのデバイス内デプロイメントを可能にした。
- t-SNE 視覚化により、発話者埋め込みが明確に分離されており、発話者エンコーダーの有効性が裏付けられた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。