[論文レビュー] Textless Speech Emotion Conversion using Discrete and Decomposed Representations
本論文は、離散的かつ分解可能な音声表現を用いて、感情変換を話されている言語の翻訳タスクとして扱う、テキストなし音声感情変換手法を提案する。コンテンツ、プロソディー、話者、感情を分離することで、音声ユニットを目的の感情に翻訳し、プロソディック特徴を予測する。この手法により、主観評価においてもテキストベースのシステムを上回る、感情認識と音声品質の最先端の性能が達成された。
Speech emotion conversion is the task of modifying the perceived emotion of a speech utterance while preserving the lexical content and speaker identity. In this study, we cast the problem of emotion conversion as a spoken language translation task. We use a decomposition of the speech signal into discrete learned representations, consisting of phonetic-content units, prosodic features, speaker, and emotion. First, we modify the speech content by translating the phonetic-content units to a target emotion, and then predict the prosodic features based on these units. Finally, the speech waveform is generated by feeding the predicted representations into a neural vocoder. Such a paradigm allows us to go beyond spectral and parametric changes of the signal, and model non-verbal vocalizations, such as laughter insertion, yawning removal, etc. We demonstrate objectively and subjectively that the proposed method is vastly superior to current approaches and even beats text-based systems in terms of perceived emotion and audio quality. We rigorously evaluate all components of such a complex system and conclude with an extensive model analysis and ablation study to better emphasize the architectural choices, strengths and weaknesses of the proposed method. Samples are available under the following link: https://speechbot.github.io/emotion.
研究の動機と目的
- 語彙的内容と話者アイデンティティを保持したまま、表現豊かで感情豊かな発話を生成する課題に対処すること。
- 非言語的発話をモデリングできない信号ベースの手法や、こうした手がかりのためのアノテーションが欠如しているテキストベースの手法の限界を克服すること。
- テキスト変換なしで高精細な感情変換を実現するために、分離された音声表現を活用すること。
- テキストなしで表現されたアプローチが、感情認識と音声品質の両面でテキストベースのシステムと同等またはそれを上回ることを示すこと。
- 全システムにおける各コンponentの寄与度を包括的にアブレーションおよび分析すること。
提案手法
- システムは、生の音声から離散的コンテンツユニット(例:発音的コンテンツ)を抽出するための音声トークナイザーを用い、離散的シーケンスモデリングを可能にする。
- シーケンス・ツー・シーケンス(S2S)モデルが、元の感情から目的の感情へのコンテンツユニットの翻訳を実行し、感情変換を話されている言語の翻訳タスクとして扱う。
- ピッチ(F0)と継続時間といったプロソディック特徴が、翻訳されたコンテンツユニットと目的の感情埋め込みに基づいて予測される。
- 最終的な音声波形は、翻訳されたコンテンツ、予測されたプロソディック特徴、話者アイデンティティ、および目的の感情を条件として用いたニューラルボコーダーによって合成される。
- この手法は音声をコンテンツ、プロソディー、話者、感情の4つの分離可能なコンポーネントに分解し、それぞれを独立して操作可能にする。
- 全パイプラインは並列データ設定で学習され、すべてのコンponentがエンド・ツー・エンドで最適化される。
実験結果
リサーチクエスチョン
- RQ1非言語的発話を(例:笑い、あくび)モデリングすることで、テキストなしのアプローチが優れた感情変換性能を達成できるか?
- RQ2コンテンツ、プロソディー、話者、感情に音声表現を分離することで、感情変換の品質がどのように向上するか?
- RQ3本手法が、感情認識と音声品質の両面で、信号ベースおよびテキストベースのベースラインをどの程度上回るか?
- RQ4システムのどのコンponent(コンテンツ翻訳、プロソディック予測、感情条件付け)が、成功した感情移転にとって最も重要か?
- RQ5中立的発話(例:LibriSpeechからのもの)のような分布外の発話に対して、モデルの一般化性能はどの程度高いか?
主な発見
- 提案手法は、怒りへの変換で86.11%、中立への変換で88.01%のeMOCスコアを達成し、ベースラインモデルを上回った。
- 分布外のLibriSpeechサンプルに対して、平均でeMOCスコア82.25%、MOS 3.69を達成し、強力な一般化性能を示した。
- 「喜び」への変換で79.12%のeMOC、「怒り」への変換で86.11%のeMOCを達成し、感情移転の成功が高く、実際の記録に近い性能を示した。
- アブレーションスタディの結果、F0と継続時間の予測のみで「眠い」状態のeMOCが70.31%に達したが、フルパイプラインでは実記録レベルに達した。
- 主観評価において、テキストベースのシステムを著しく上回り、感情認識と音声品質の両方でMOSおよびeMOCスコアがテキストベースのベースラインを上回った。
- 本システムは、笑いの挿入やあくびの削除といった非言語的発話を効果的にモデリングできており、これは通常、信号ベースおよびテキストベースのアプローチが見逃す手がかりである。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。