Skip to main content
QUICK REVIEW

[論文レビュー] Speaker De-identification System using Autoencoders and Adversarial Training

Fernando Espinoza-Cuadros, Juan M. Perero-Codosero|arXiv (Cornell University)|Nov 9, 2020
Speech Recognition and Synthesis被引用数 7
ひとこと要約

本稿では、敵対的訓練とオートエンコーダーを用いたスピーカー脱特定システムを提案し、話者の特徴、性別、発音の違いを抑える一方で、話者の理解可能性を維持する。この手法は、話者認証における等誤差率(EER)を顕著に向上させ、テストセットで最大48.39%まで上昇させ、話者の自然さを損なわず、プライバシー保護を効果的に行うことを示している。

ABSTRACT

The fast increase of web services and mobile apps, which collect personal data from users, increases the risk that their privacy may be severely compromised. In particular, the increasing variety of spoken language interfaces and voice assistants empowered by the vertiginous breakthroughs in Deep Learning are prompting important concerns in the European Union to preserve speech data privacy. For instance, an attacker can record speech from users and impersonate them to get access to systems requiring voice identification. Hacking speaker profiles from users is also possible by means of existing technology to extract speaker, linguistic (e.g., dialect) and paralinguistic features (e.g., age) from the speech signal. In order to mitigate these weaknesses, in this paper, we propose a speaker de-identification system based on adversarial training and autoencoders in order to suppress speaker, gender, and accent information from speech. Experimental results show that combining adversarial learning and autoencoders increase the equal error rate of a speaker verification system while preserving the intelligibility of the anonymized spoken content.

研究の動機と目的

  • 音声アプリケーションや音声アシスタントにおける音声データ収集に伴うプライバシー懸念の増大に対処すること。
  • 話者の特定特徴(性別、発音、アイデンティティなど)を音声信号から抑制し、模倣やプロファイリングを防ぐこと。
  • 話者の理解可能性と自然さを保ちながら、柔軟で暗号化ではない匿名化手法を開発すること。
  • オートエンコーダーと敵対的訓練を組み合わせることで、強固な話者不変表現学習を実現し、既存の話者脱特定技術を改善すること。
  • 標準化されたベンチマーク(例:VoicePrivacy 2020)を用いて評価することで、再現可能性と公平性を確保すること。

提案手法

  • 本システムは、VoicePrivacy 2020チャレンジのベースラインx-vector匿名化パイプラインに基づき、x-vector匿名化段階に焦点を当てる。
  • オートエンコーダーを用いて入力x-vectorを再構築し、圧縮された話者不変表現を学習する。
  • 敵対的ディスクライマーを訓練し、匿名化されたx-vectorを話者アイデンティティ、性別、発音で分類する。
  • エンコーダーは敵対的訓練により同時に最適化され、話者特徴の識別能力を最小限に抑える。
  • 再構築損失(L2)と敵対的損失を組み合わせた損失関数を用い、忠実度と脱特定性能のバランスを取る。
  • 最終的な匿名化x-vectorを用いて、言語的内容は保持されるが話者固有の手がかりが除去された音声を合成する。

実験結果

リサーチクエスチョン

  • RQ1オートエンコーダーと敵対的訓練を組み合わせることで、x-vectorからの話者アイデンティティ、性別、発音の抑制が有効に行えるか?
  • RQ2脱特定処理後、話者の理解可能性とASR性能はどの程度維持されるか?
  • RQ3異なるテストセット(例:LibriTTS、VCTK)において、話者や録音環境の違いがある中で、本システムの性能はいかがなものか?
  • RQ4オートエンコーダーと敵対的訓練の組み合わせは、ベースライン匿名化手法に比べ、プライバシー漏洩の低減において優れているか?
  • RQ5脱特定性能と音声品質の維持の間には、どのようなトレードオフが生じるか?

主な発見

  • AAN-2モデルは、元の音声を登録し、匿名化された音声でテストした場合、vctk_test_difセットでEERが48.39%に達し、話者アイデンティティの強力な抑制を示している。
  • libri_testセットでは、AAN-1モデルが元の音声から匿名化された音声への試行でEERが47.26%を記録し、ベースラインから顕著な向上を示している。
  • システムは低いC_llr値(AAN-1を用いたlibri_testでは0.995)を維持しており、匿名化された音声が下流のASRタスクに適していることを示している。
  • 敵対的訓練のコンponentにより、ディスクライマーの話者特徴識別精度が顕著に低下し、すべてのテストセットで高いEERが確認された。
  • 話者の自然さと理解可能性が維持されており、C_llr値が低く、ASR性能の低下も最小限に抑えられていることが確認された。
  • オートエンコーダーと敵対的訓練の組み合わせにより、すべてのテスト条件下でEERが一貫して上昇し、脱特定アプローチの有効性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。