[論文レビュー] Hi-Fi Multi-Speaker English TTS Dataset
本論文では、10名のネイティブ英語話者(女性6名、男性4名)からなる高精細でマルチスプーカーなコーパス、Hi-Fi Multi-Speaker English TTSデータセットを紹介する。合計292時間の音声が収録されており、各話者は最低17時間以上の音声を有している。44.1 kHzで録音された音声は、信号帯域幅 ≥13 kHz、SNR ≥32 dB、およびASR検証によるゼロワードエラーレート(WER)という厳密なフィルタリングを経て高品質を確保しており、より表現的で高精細なTTSモデルのトレーニングに最適である。これにより、一般化性能が向上し、アーティファクトが低減される。
This paper introduces a new multi-speaker English dataset for training text-to-speech models. The dataset is based on LibriVox audiobooks and Project Gutenberg texts, both in the public domain. The new dataset contains about 292 hours of speech from 10 speakers with at least 17 hours per speaker sampled at 44.1 kHz. To select speech samples with high quality, we considered audio recordings with a signal bandwidth of at least 13 kHz and a signal-to-noise ratio (SNR) of at least 32 dB. The dataset is publicly released at http://www.openslr.org/109/ .
研究の動機と目的
- 高品質でマルチスプーカーな英語TTSデータセットが、十分な音声品質と話者多様性を備えているという不足を補うこと。
- 一般化性能が高く、ノイズが少なく、より広範なボイスバリエーションを提供するTTSモデルのトレーニングを可能にすること。
- 検証済みのテキスト・オーディオ同期と高精度な信号忠実度を備えた、公開可能で倫理的に調達されたデータセットを提供すること。
- LJSpeech や M-AILABS といった既存データセットの制限を克服すること。これらは低サンプリングレートを用いており、音声品質の厳密な検証が欠如している。
- 非プロの LibriVox 読者の収録音声からでも、プロフェッショナルクラスの音声品質を得られるデータセットを提供し、表現的で高精細なTTS研究を支援すること。
提案手法
- データセットは、パブリックドメインにある LibriVox のオーディオブックおよび Project Gutenberg のテキストから構築された。
- 話者は、最低50時間の音声と、信号帯域幅 ≥13 kHz、SNR ≥32 dB の高品質録音を満たすものとして選定された。
- 音声ファイルは16 kHzにダウンサンプリングされ、QuartzNet および Citrinet ASR モデルを用いてWERを計算し、テキスト・オーディオ同期の検証が行われた。
- CTC-Segmentation を用いてテキスト・オーディオ同期を実施し、ログ空間における信頼度閾値 -2 を用いて、低品質な同期をフィルタリングした。
- 両方のASRモデルでゼロWERが達成された発話のみが保持され、高精度なテキスト・オーディオ一致が保証された。
- 最終的なデータセットには「clean」(SNR ≥40 dB)と「other」(SNR ≥32 dB)の2つのサブセットが含まれており、10名の話者、各話者あたり最低17時間の収録が確保された。

実験結果
リサーチクエスチョン
- RQ1パブリックドメインのオーディオブックから、商業的ライセンス制約なしにプロフェッショナルクラスの音声品質を達成できるマルチスプーカーTTSデータセットを構築できるか?
- RQ2複数のASRモデルによるゼロWERフィルタリングは、非プロの録音において、正確なテキスト・オーディオ同期を確保するのにどの程度有効か?
- RQ3高SNRとワイドバンド信号コンテンツは、TTSモデルの一般化性能を向上させ、合成アーティファクトを低減するのにどの程度寄与するか?
- RQ4音声品質とテキスト同期が厳密に検証された場合、非プロの録音からも高精細TTSモデルを効果的にトレーニングできるか?
- RQ5非プロの読者による多様で高品質なボイスを含めることで、TTSシステムの表現力と耐性はどの程度向上するか?
主な発見
- Hi-Fi TTSデータセットには、10名のネイティブ英語話者から合計292時間の音声が含まれており、各話者は最低17.7時間の音声を提供している。
- すべての音声サンプルは44.1 kHzでサンプリングされ、最低SNR 32 dBおよび最低13 kHzの信号帯域幅に基づいて選別された。
- データセットには「clean」(SNR ≥40 dB)と「other」(SNR ≥32 dB)の2つのサブセットが含まれており、一部の話者が本の品質差異により両方のサブセットに含まれる。
- テキスト・オーディオ同期は、2つのASRモデル(QuartzNet および Citrinet)を用いて検証され、ゼロWERのサンプルのみが含まれており、高精度な同期が保証された。
- データセットは、http://www.openslr.org/109/ にてCC BY 4.0ライセンスで公開されており、すべての話者から音声再現のための倫理的同意が得られている。
- データセットはLJSpeech や M-AILABS と重複せず、LibriTTS と一部の話者が重複する可能性はあるが、優れた音声品質と一貫性を提供している。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。