[論文レビュー] SpeechX: Neural Codec Language Model as a Versatile Speech Transformer
SpeechX は、タスク固有のプロンプトを用いたマルチタスク学習により、一貫したアーキテクチャでゼロショットTTS、ノイズ抑制、ターゲットスピーカー抽出、音声除去、音声編集—クリアな状態およびノイズがある状態の両方で—を実現する統合型ニューラルコーデック言語モデルであり、最先端または競争力のある性能を達成している。
Recent advancements in generative speech models based on audio-text prompts have enabled remarkable innovations like high-quality zero-shot text-to-speech. However, existing models still face limitations in handling diverse audio-text speech generation tasks involving transforming input speech and processing audio captured in adverse acoustic conditions. This paper introduces SpeechX, a versatile speech generation model capable of zero-shot TTS and various speech transformation tasks, dealing with both clean and noisy signals. SpeechX combines neural codec language modeling with multi-task learning using task-dependent prompting, enabling unified and extensible modeling and providing a consistent way for leveraging textual input in speech enhancement and transformation tasks. Experimental results show SpeechX's efficacy in various tasks, including zero-shot TTS, noise suppression, target speaker extraction, speech removal, and speech editing with or without background noise, achieving comparable or superior performance to specialized models across tasks. See https://aka.ms/speechx for demo samples.
研究の動機と目的
- ノイズありおよびマルチタッカー音声の変換を含む、多様な音声-テキスト音声タスクを処理できる統合型生成モデルの不足に対処する。
- 従来のモデルがノイズあり信号での音声編集ができない、または特別なアーキテクチャを必要とするターゲットスピーカー抽出に対処できないという制限を克服する。
- テキストと音声プロンプトの一貫した条件付けを用いて、単一で拡張可能なモデルアーキテクチャで、ロバストなゼロショット音声生成と変換を可能にする。
- TTS、ノイズ除去、スピーカー抽出、除去、編集といった複数の音声タスクを、タスク固有のトークンを用いた単一のニューラルコーデック言語モデリングフレームワークに統合する。
- 多様な音声状態で学習することで、音声歪みに対するモデルのロバスト性を向上させつつ、タスク全体で高品質な出力を維持する。
提案手法
- テキストと音声プロンプトの両方に条件付けられた離散的音声トークンを生成するニューラルコーデック言語モデルを採用し、エンドツーエンドの音声生成と変換を可能にする。
- マルチタスク学習を用いて、一貫したモデルアーキテクチャ内に多様なタスクを統合するため、タスク固有の条件付けトークン(例:'TTS'、'denoise'、'extract')を導入する。
- 音声強化および変換をガイドするため、オプションではあるが情報量の多いプロンプトとしてテキスト入力を用いることで、分離性と明瞭性を向上させる。
- 音声のエンドツーエンド学習を、ゼロショットTTS、音声編集、ノイズ抑制、音声除去、ターゲットスピーカー抽出を含む、タスクの混合物に対して行い、音声およびテキストエンコーダーを共有する。
- 音声トークン化にEnCodecモデルを活用するが、特にPESQスコアでコーデック由来の劣化が顕著に見られ、性能に制限が生じる。
- 入力音声、必要に応じてテキスト、およびタスク固有のトークンに条件付けられた音声トークンを生成する、統一された推論メカニズムを適用する。
実験結果
リサーチクエスチョン
- RQ1単一の統合型生成モデルは、ノイズ環境下でのゼロショットTTSや音声変換を含め、多様な音声-テキストベースの音声タスクを効果的に処理できるか?
- RQ2テキスト入力をプロンプトとして組み込むことで、ノイズ抑制やターゲットスピーカー抽出といった音声強化および変換タスクの性能がどのように向上するか?
- RQ3マルチタスク学習が、さまざまな音声生成および変換タスクにおけるロバスト性と一般化性能をどの程度向上させるか?
- RQ4ニューラルコーデックの使用が、PESQ や DNSMOS といった品質指標の観点から、下流の音声生成および変換タスクの性能にどのような影響を与えるか?
- RQ5従来のモデルがクリアな入力に限定される中で、統合型モデルはノイズあり信号での音声編集において競争力のある性能を達成できるか?
主な発見
- SpeechX は、ゼロショットTTS、ノイズ抑制、ターゲットスピーカー抽出、音声除去、音声編集の全タスクにおいて、専用モデルと比較して競争的または優れた性能を達成している。
- テキスト入力の有無が、ターゲットスピーカー抽出タスクにおけるDNSMOSおよびWERスコアの向上に顕著に寄与しており、干渉する話者の声の分離性が向上していることが示唆される。
- 音声編集タスクの学習により、ゼロショットTTSの性能が向上しており、タスクの多様性に起因する有益なデータ分布シフトが示唆される。
- ノイズ抑制および音声除去タスクの学習を組み込むことで、ノイズ環境下での音声編集のロバスト性が向上するが、クリアな音声編集の品質にわずかなトレードオフが生じる。
- EnCodecを音声トークン化に用いることで、クリアな音声においてPESQスコアが4.64から2.69に著しく低下しており、評価指標とのコーデックの不一致に起因する性能ボトルネックが明らかになった。
- ターゲットスピーカー抽出を学習に含めても、ノイズ抑制および音声除去タスクの性能に劣化が見られず、両タスクの強力な性能維持が確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。