[論文レビュー] Defending Your Voice: Adversarial Attack on Voice Conversion
本論文は、個人の話者IDを保護するための音声変換システムに対する、初めての敵対的攻撃を提示する。話者の発話に人間が感知できないノイズを注入することで、ゼロショット音声変換モデルの動作を乱し、変換出力が防御対象の話者と似た音声ではなくなるようにする。一方で、白ボックスおよびブラックボックスの両設定において、敵対的入力を客観的および主観的評価で本物の発話と区別できないままに保つ。
Substantial improvements have been achieved in recent years in voice conversion, which converts the speaker characteristics of an utterance into those of another speaker without changing the linguistic content of the utterance. Nonetheless, the improved conversion technologies also led to concerns about privacy and authentication. It thus becomes highly desired to be able to prevent one's voice from being improperly utilized with such voice conversion technologies. This is why we report in this paper the first known attempt to perform adversarial attack on voice conversion. We introduce human imperceptible noise into the utterances of a speaker whose voice is to be defended. Given these adversarial examples, voice conversion models cannot convert other utterances so as to sound like being produced by the defended speaker. Preliminary experiments were conducted on two currently state-of-the-art zero-shot voice conversion models. Objective and subjective evaluation results in both white-box and black-box scenarios are reported. It was shown that the speaker characteristics of the converted utterances were made obviously different from those of the defended speaker, while the adversarial examples of the defended speaker are not distinguishable from the authentic utterances.
研究の動機と目的
- 先進的な音声変換技術が個人を模倣できるという増大するプライバシー懸念に対処すること。
- 話者の声が変換攻撃に対して耐性を持つ防御メカニズムを開発し、不正な音声変換を防ぐこと。
- 生成モデル、特に判別モデルと比較して未だ十分に調査が進んでいない音声変換に対する敵対的攻撃を検討すること。
- 現実的(ブラックボックス)な状況下で、客観的な話者認証と主観的な聴取テストの両方を用いて有効性を評価すること。
提案手法
- 音声変換モデルが処理する前に、話者の発話に人間が感知できない敵対的ノイズを注入する。
- エンドツーエンド攻撃、エンベッディング攻撃、フィードバック攻撃の3つの攻撃戦略を提案し、音声変換パイプラインの異なるコンponentを標的とする。
- コンテンツエンコーダーと話者エンコーダーを別々に持つ標準的なエンコーダデコーダアーキテクチャを採用し、話者エンコーダーの入力を変更することで話者表現を操作する。
- 防御対象話者と変換出力との間の話者エンベッディング空間における差を最大化する損失関数を用いて、摂動を最適化する。
- 白ボックス(モデルの完全なアクセスあり)およびブラックボックス(プロキシモデルあり)の両設定で攻撃を適用し、実世界の展開を模擬する。
- 客観的指標(例:話者認証精度)と主観的な聴取テスト(人間の評価者を用いて)を用いて攻撃の有効性を検証する。

実験結果
リサーチクエスチョン
- RQ1人間が感知できないノイズを用いて、ゼロショット音声変換モデルを破壊することは可能か? また、元の発話の音声品質は劣化しないか?
- RQ2客観的および主観的評価において、敵対的攻撃が変換音声が防御対象話者と異なるものになるように効果的に機能するか?
- RQ3攻撃者がターゲットモデルの詳細をほとんど知らないブラックボックス状況でも攻撃は有効に機能するか?
- RQ4人間の聴取者が、敵対的出力が防御対象話者と異なると感じるのはどの程度か? また、元の発話との比較でどの程度の違いを感じ取るか?
- RQ5ChouのモデルやAutoVCといった最先端の音声変換モデルに対しても、本攻撃は一貫した結果をもたらすか?
主な発見
- 白ボックス状況では、Chouのモデルでは敵対的出力の話者認証精度が1.5%まで低下し、AutoVCでは2.5%まで低下した。これは防御対象話者から著しく逸脱していることを示している。
- 主観的評価では、58%を超える聴取者が敵対的出力を別の話者から発話したものと判断した(カテゴリーI)。一方で、70%を超える聴取者が敵対的入力が元の話者と同一であると認識した。
- ブラックボックス攻撃でも効果的であり、Chouのモデルでは12.0%、AutoVCでは19.5%の話者認証スコアが、変換音声が別の話者から出たものであると示した。
- AutoVCでは、元の出力が同じ話者であると認識した聴取者がわずか27%にとどまり、客観的指標と人間の認識の間に乖離があることが示された。
- 敵対的入力は音声品質を保持しており、客観的および主観的テストの両方で本物の発話と区別がつかなかった。
- 本手法は、さまざまなモデルや設定に対して頑健であり、白ボックスおよびブラックボックス評価の両方で一貫した性能を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。