Skip to main content
QUICK REVIEW

[論文レビュー] Speaker Anonymization Using X-vector and Neural Waveform Models

Fuming Fang, Xin Wang|arXiv (Cornell University)|May 30, 2019
Speech Recognition and Synthesis参考文献 21被引用数 8
ひとこと要約

本稿では、x-ベクトルとニューラル波形モデルを用いて言語的コンテンツと話者アイデンティティを分離する話者匿名化手法を提案する。複数のランダムな話者のx-ベクトルを組み合わせて仮想話者アイデンティティを生成し、言語的コンテンツにはフォネム後続確率グラム(PPG)を用いることで、話者アイデンティティを効果的に隠蔽する(EERが最大10.8倍に向上)一方で、音声品質は維持され、ASR認識精度にわずかな劣化しか生じない。

ABSTRACT

The social media revolution has produced a plethora of web services to which users can easily upload and share multimedia documents. Despite the popularity and convenience of such services, the sharing of such inherently personal data, including speech data, raises obvious security and privacy concerns. In particular, a user's speech data may be acquired and used with speech synthesis systems to produce high-quality speech utterances which reflect the same user's speaker identity. These utterances may then be used to attack speaker verification systems. One solution to mitigate these concerns involves the concealing of speaker identities before the sharing of speech data. For this purpose, we present a new approach to speaker anonymization. The idea is to extract linguistic and speaker identity features from an utterance and then to use these with neural acoustic and waveform models to synthesize anonymized speech. The original speaker identity, in the form of timbre, is suppressed and replaced with that of an anonymous pseudo identity. The approach exploits state-of-the-art x-vector speaker representations. These are used to derive anonymized pseudo speaker identities through the combination of multiple, random speaker x-vectors. Experimental results show that the proposed approach is effective in concealing speaker identities. It increases the equal error rate of a speaker verification system while maintaining high quality, anonymized speech.

研究の動機と目的

  • 音声データ共有に伴うプライバシーリスク、特にボイススプーフィングや話者認証攻撃の可能性に対処する。
  • 音声品質や言語的コンテンツを損なわずに話者アイデンティティを隠蔽する手法を開発すること。
  • ディープラーニングコンponentsを用いた柔軟で話者に依存しない匿名化フレームワークを構築すること。
  • 客観的指標(EER、WER)と主観的MOSスコアを用いて匿名化の有効性を評価すること。
  • 現在の言語的特徴と話者特徴の分離の限界を特定し、今後の改善策を提案すること。

提案手法

  • 入力音声から話者アイデンティティ特徴を抽出するために事前学習済みのx-ベクトルシステムを用いる。
  • 言語的コンテンツは、話者に依存しないASRシステムから抽出されたフォネム後続確率グラム(PPG)によって表現する。
  • 複数のランダムで未学習の話者のx-ベクトルを平均化することで、匿名化された仮想話者アイデンティティを生成する。
  • ニューラル音声生成モデルと波形生成モデルが、PPGと平均化されたx-ベクトルを用いて匿名化音声を合成する。
  • 本手法は、コンテンツにPPG、アイデンティティに組み合わせたx-ベクトルを用いることで、分離された表現に依存する。
  • 個々の話者に合わせたモデル適応を回避するため、単一の変換関数を用いてエンドツーエンドで学習する。

実験結果

リサーチクエスチョン

  • RQ1複数のランダムなx-ベクトルから得た学習済みの仮想話者アイデンティティを用いて、話者アイデンティティを効果的に隠蔽できるか?
  • RQ2ASRシステムのWERで測定した場合、匿名化音声の言語的忠実度はどの程度保持されているか?
  • RQ3MOSと知覚的類似度の観点から、匿名化音声の品質は元の音声と比べてどの程度か?
  • RQ4匿名化が話者認証システムに与える影響は、EERの上昇によってどの程度測定できるか?
  • RQ5PPG層の選択(6番目のシグモイド層対ソフトマックス層)が、アイデンティティの隠蔽と音声品質のバランスにどのように影響するか?

主な発見

  • 提案手法により、話者認証システムの等誤差率(EER)が最大10.8倍に向上し、強力な匿名化性能が示された。
  • 平均意見スコア(MOS)で測定した音声品質は高く維持され、匿名化音声のスコアは2.31~3.25であったのに対し、自然音声は4.05であった。
  • ASRシステムのWERは、自然音声時が9.49%であったのに対し、6番目の層からのPPGでは10%~30%に、ソフトマックス層からのPPGでは25%~45%に上昇し、言語的コンテンツに中程度の劣化が生じた。
  • x-ベクトルの平均化距離が大きいほどアイデンティティの隠蔽が向上し、75%の評価者が匿名化音声を元の話者と異なると判断した。
  • 6番目のシグモイド層からのPPG抽出は、ソフトマックス層からのものよりも音声品質が高く、WERも低かったため、より優れた表現学習が可能であった。
  • 本手法は話者アイデンティティと言語的コンテンツの分離を大きく達成したが、不完全な分離により、類似度が0.4を超えた場合にWERが上昇した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。