Skip to main content
QUICK REVIEW

[論文レビュー] NWPU-ASLP System for the VoicePrivacy 2022 Challenge

Jixun Yao, Qing Wang|arXiv (Cornell University)|Sep 24, 2022
Speech Recognition and Synthesis被引用数 5
ひとこと要約

本論文は、VoicePrivacy 2022チャレンジ向けに、外部のASVモデルやx-vectorプールに依存しないスピーカー匿名化システムを提示する。疑似スティーラー埋め込みを生成し、それを平均化された実スティーラー埋め込みと重み付き連結することで、高いプライバシー性と音声の明瞭性を実現する。平均EERは30.15%、WERは5.82%を達成し、プライバシー性と有用性の両面でベースラインを上回った。

ABSTRACT

This paper presents the NWPU-ASLP speaker anonymization system for VoicePrivacy 2022 Challenge. Our submission does not involve additional Automatic Speaker Verification (ASV) model or x-vector pool. Our system consists of four modules, including feature extractor, acoustic model, anonymization module, and neural vocoder. First, the feature extractor extracts the Phonetic Posteriorgram (PPG) and pitch from the input speech signal. Then, we reserve a pseudo speaker ID from a speaker look-up table (LUT), which is subsequently fed into a speaker encoder to generate the pseudo speaker embedding that is not corresponding to any real speaker. To ensure the pseudo speaker is distinguishable, we further average the randomly selected speaker embedding and weighted concatenate it with the pseudo speaker embedding to generate the anonymized speaker embedding. Finally, the acoustic model outputs the anonymized mel-spectrogram from the anonymized speaker embedding and a modified version of HifiGAN transforms the mel-spectrogram into the anonymized speech waveform. Experimental results demonstrate the effectiveness of our proposed anonymization system.

研究の動機と目的

  • 追加のASVモデルやx-vectorプールを必要としないスピーカー匿名化システムの開発。これにより、複雑さと一般化のリスクが低減される。
  • 言語的コンテンツと音声の明瞭性を保持しつつ、効果的にスティーラーのアイデンティティ情報を抑制すること。
  • 実在のスティーラーと関連付けられていない匿名化された音声を生成し、プライバシー保護を強化すること。
  • 新しい埋め込み結合戦略を通じて、匿名化のロバスト性と効果性を向上させること。

提案手法

  • 特徴抽出器を用いて、入力音声から音声的後方確率(PPG)と基本周波数(F0)を取得する。
  • ラックアップテーブルに疑似スティーラーIDを予約し、架空のスティーラー埋め込みを生成することで、匿名化出力が実在のスティーラーと関連付けられないようにする。
  • ランダムに選択された実スティーラー埋め込みを平均化し、平均化された埋め込みと疑似スティーラー埋め込みを重み付き連結することで匿名化埋め込みを形成する。
  • 音声モデルが、匿名化埋め込みと言語的特徴(PPG、F0)を条件としてメルスペクトログラムを生成する。
  • 再訓練されたHifiGANベースのニューラルボコーダーが、匿名化されたメルスペクトログラムを自然な音声波形に変換する。
  • 外部のASVモデルやx-vectorプールに依存しないため、一般化性能が向上し、計算オーバーヘッドが低減される。

実験結果

リサーチクエスチョン

  • RQ1外部のASVモデルやx-vectorプールに依存せずに、スティーラー匿名化を効果的に実現できるか?
  • RQ2疑似スティーラー埋め込みと平均化された実スティーラー埋め込みを組み合わせることで、匿名化性能にどのような影響を与えるか?
  • RQ3提案手法は、スティーラーのアイデンティティをどの程度抑制しつつ、音声の明瞭性を保持できるか?
  • RQ4プライバシー指標(EER)と有用性(WER)の観点から、ベースライン手法と比較してどのように差がつくか?

主な発見

  • 提案手法は平均30.15%の等誤り率(EER)を達成し、B1.bベースライン比で20.97%の改善を示し、強力なプライバシー保護を実現した。
  • 本手法は5.82%の語誤り率(WER)を達成し、B1.bベースライン比で1.74%低く、優れた音声明瞭性を示した。
  • 本システムは、LibriSpeechやVCTKを含むすべてのテストセットで、両方のベースラインを上回り、EERおよびWERの両面で一貫した改善を示した。
  • 声の特徴性指標$G_{VD}$が顕著に低下し、匿名化された音声がスティーラー固有の特徴を失ったが、言語的コンテンツは保持されたことが確認された。
  • すべての条件下でピッチ相関係数が0.7以上を維持したため、基本周波数が保持されており、自然な音声品質が保たれていることが示された。
  • 疑似スティーラー埋め込みの類似度行列に顕著な対角成分が存在しなかったため、疑似スティーラーが実スティーラーと一致していないことが確認され、プライバシー性が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。