[論文レビュー] EmoFake: An Initial Dataset for Emotion Fake Audio Detection
本稿では、感情偽造音声検出のための最初の公開データセットであるEmoFakeを紹介する。このデータセットは、実際の感情付き発話と、7つのオープンソースの感情音声変換(EVC)モデルを用いて生成された偽物の音声を含む。本稿では、深層感情埋め込みを用いたグラフ自己注意ネットワークであるGADEを提案し、ターゲット感情検出において0.51%のEERを達成し、最先端の性能を示した。これは、新たなベンチマークにおいて既存のモデルを上回っている。
Many datasets have been designed to further the development of fake audio detection, such as datasets of the ASVspoof and ADD challenges. However, these datasets do not consider a situation that the emotion of the audio has been changed from one to another, while other information (e.g. speaker identity and content) remains the same. Changing the emotion of an audio can lead to semantic changes. Speech with tampered semantics may pose threats to people's lives. Therefore, this paper reports our progress in developing such an emotion fake audio detection dataset involving changing emotion state of the origin audio named EmoFake. The fake audio in EmoFake is generated by open source emotion voice conversion models. Furthermore, we proposed a method named Graph Attention networks using Deep Emotion embedding (GADE) for the detection of emotion fake audio. Some benchmark experiments are conducted on this dataset. The results show that our designed dataset poses a challenge to the fake audio detection model trained with the LA dataset of ASVspoof 2019. The proposed GADE shows good performance in the face of emotion fake audio.
研究の動機と目的
- 発話の話者IDと内容はそのままで感情のみが変更された偽物音声に焦点を当てたデータセットの不足に対処すること。
- 発話における感情操作に起因する意味的リスクを捉えたベンチマークデータセットを構築すること。
- 既存の偽物音声検出モデルが感情偽物音声に対してどれほど頑健であるかを評価すること。
- 感情偽物音声に特化して設計された、新たな検出手法GADEを提案し、実証すること。
- 今後の感情認識型偽物音声検出研究を加速させるために、EmoFakeで訓練されたベースラインモデルを提供すること。
提案手法
- EmoFakeはESDデータセットから構築され、5名の男性および女性の話者が、ニュートラル、ハッピー、怒り、悲しみ、驚きの5つの感情をそれぞれ350文ずつ発話した。
- 偽物音声は、VAW-GAN-CWT、DeepEST、Seq2seq-EVC、CycleGAN-EVC、CycleTransGAN、EmoCycleGAN、StarGAN-EVCの7つのオープンソースEVCモデルを用いて生成された。
- GADEは、発話間の関係をモデル化するためのグラフ自己注意ネットワークを採用し、事前学習済みの感情認識システムから抽出された深層感情埋め込みを統合している。
- モデルは、長距離依存関係および音声系列内の感情的不一致を捉えるために、グラフベースのアーキテクチャを用いている。
- 感情埋め込みは、グラフ内のノード特徴として使用され、異なる発話を検出する際の重要度を重みづけするための自己注意メカニズムが用いられている。
- フレームワークはEmoFakeデータセット上でエンドツーエンドに訓練され、未学習の感情遷移およびEVCモデルタイプに対する評価が行われた。
実験結果
リサーチクエスチョン
- RQ1話者と内容はそのままで感情のみが変更された偽物音声に対して、既存の偽物音声検出モデルの性能はどの程度低下するか?
- RQ2どの感情音声変換(EVC)モデルが、標準的な検出モデルを欺くのに最も効果的な偽物音声を生成するか?
- RQ3GADEのような専用モデルは、一般向けの偽物音声検出器よりも、感情偽物音声に対して優れた性能を示せるか?
- RQ4ターゲットとなる感情の選択が、感情偽物音声の検出可能性にどのように影響するか?
- RQ5EmoFakeデータセット上で既存モデルをファインチューニングすることで、感情ベースの操作に対するモデルの頑健性はどの程度向上するか?
主な発見
- ASVspoof 2019のLAデータセットはEmoFakeに一般化できない。全テストモデルが感情偽物音声に対してEERが上昇し、顕著な性能低下が示された。
- GADEは、ターゲット感情が「驚き」の場合に0.51%のEERを達成し、「ハッピー」では0.55%を記録し、すべてのベースラインを上回った。
- LCNNはResNet34やSENetよりも感情偽物音声に対してより頑健であった。後者は全感情遷移において顕著な性能低下を示した。
- Seq2seq-EVCモデル(S3)によって生成された偽物音声が最も検出が困難であった。これは、EVCモデルのアーキテクチャの違いが検出可能性に影響することを示唆している。
- EmoFakeでファインチューニングされたベースラインモデルは一般化性能が向上し、特にGADEは全感情遷移において強力な性能を維持した。
- 検出モデルの性能はターゲット感情によって顕著に異なる。RawNet2では「驚き」が最も検出されやすく(EER最大7.26%)、SENetおよびResNet34では「ハッピー」と「驚き」が最も検出が困難であった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。