[論文レビュー] Incremental Text-to-Speech Synthesis with Prefix-to-Prefix Framework
この論文は、音声を再生しながらリアルタイムに音声を生成することで、O(1)の遅延を達成するインクリメンタル音声合成のためのプレフィックス・ツー・プレフィックスフレームワークを提案している。全文を処理するTTSと同等の自然さを維持しつつ、リアルタイムでの音声生成が可能であり、対話システムや支援技術などのリアルタイム応用に適している。1〜2語の先行読み込みで十分な文脈を得られ、低遅延で連続的な音声出力を実現する。
Text-to-speech synthesis (TTS) has witnessed rapid progress in recent years, where neural methods became capable of producing audios with high naturalness. However, these efforts still suffer from two types of latencies: (a) the {\em computational latency} (synthesizing time), which grows linearly with the sentence length even with parallel approaches, and (b) the {\em input latency} in scenarios where the input text is incrementally generated (such as in simultaneous translation, dialog generation, and assistive technologies). To reduce these latencies, we devise the first neural incremental TTS approach based on the recently proposed prefix-to-prefix framework. We synthesize speech in an online fashion, playing a segment of audio while generating the next, resulting in an $O(1)$ rather than $O(n)$ latency.
研究の動機と目的
- 入力テキストが段階的に到着するような状況において、ニューラルTTSシステムの計算および入力遅延を低減すること。
- 再トレーニングを必要とせず、高い音声自然さを保ちながら、リアルタイムで低遅延のTTS合成を可能にすること。
- 音声生成が再生と同期するようにすることで、滑らかで連続的な音声再生を実現すること。
- CPUおよびGPUでの効率的な推論を実現することで、デバイス内TTSの実用的妥当性を示すこと。
提案手法
- 同時翻訳から適応されたプレフィックス・ツー・プレフィックス推論フレームワークをニューラルTTSに適用し、段階的な生成を可能にする。
- モノトニックアテンション機構を用いて入力依存関係を局所化し、再トレーニングを伴わずに安全で安定した段階的推論を実現する。
- k語分(k=1または2)の先行読み込みポリシーを実装し、高品質な合成に十分な文脈を得られるようにする。
- テキスト→発音、発音→スペクトログラム、スペクトログラム→波形のモジュラーな段階にTTSパイプラインを分解し、並列処理を可能にする。
- 音声チャンクが合成され次第すぐに再生することで、オンライン音声再生を実現し、エンドツーエンド遅延を最小限に抑える。
- 時間バランス解析を用いて、音声生成が再生の次のチャンク開始前に常に完了することを確認し、途切れのないストリーミングを保証する。
実験結果
リサーチクエスチョン
- RQ1プレフィックス・ツー・プレフィックスフレームワークは、再トレーニングを伴わずにニューラルTTSに効果的に適応可能であり、低遅延合成を達成できるか?
- RQ2提案された段階的TTS手法は、全文TTSと比較して音声自然さと遅延の点でどのように異なるか?
- RQ3異なる文の長さや言語に対しても、システムは途切れのない連続的な音声再生を維持できるか?
- RQ4段階的TTSにおける先行読み込み長(k)が音声品質と遅延に与える影響は何か?
- RQ5この手法は、デバイス内デプロイに適したCPUおよびGPUでの効率的推論をサポートできるか?
主な発見
- 提案された段階的TTSはO(1)の遅延を達成しており、文の長さにかかわらず英語および中国語の両方で合成時間が0.3秒未満である。これに対して、全文TTSではO(n)の遅延が生じる。
- MOSによる音声品質の測定では、段階的生成のアプローチにもかかわらず、全文TTSと同等の品質が得られ、顕著な劣化は認められない。
- 時間バランス解析により、音声生成が次のチャンクの再生開始前に常に完了していることが確認され、途切れのない再生が可能であることが裏付けられた。
- シャロウイング実験では、段階的TTSの遅延は英語および中国語の両方で2.5秒未満の一定値を維持しているが、全文TTSでは文の長さに比例して遅延が増加した。
- この手法はCPUおよびGPUの両方で効率的な推論を実現しており、デバイス内TTSデプロイの実現可能性を示している。
- 先行読み込み-1および先行読み込み-2ポリシーは、両方の遅延と音声品質においてベースライン手法を上回っており、先行読み込み文脈の重要性が浮き彫りになった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。