[論文レビュー] Beyond $L_p$ clipping: Equalization-based Psychoacoustic Attacks against ASRs
本稿では、人間の聴覚マスキングを利用し、従来型およびエンド・ツー・エンドの自動音声認識(ASR)システムに対して、人間が感知できない悪意ある音声を生成する等化に基づく心理音響攻撃を提案する。心理音響マスキング閾値を用いて摂動を制約することで、DeepSpeechでは100%、Wav2Letterでは76%の成功率を達成し、ユーザー研究により最先端の$L_p$ベースの攻撃と比較して著しく低い音声歪みが確認された。
Automatic Speech Recognition (ASR) systems convert speech into text and can be placed into two broad categories: traditional and fully end-to-end. Both types have been shown to be vulnerable to adversarial audio examples that sound benign to the human ear but force the ASR to produce malicious transcriptions. Of these attacks, only the "psychoacoustic" attacks can create examples with relatively imperceptible perturbations, as they leverage the knowledge of the human auditory system. Unfortunately, existing psychoacoustic attacks can only be applied against traditional models, and are obsolete against the newer, fully end-to-end ASRs. In this paper, we propose an equalization-based psychoacoustic attack that can exploit both traditional and fully end-to-end ASRs. We successfully demonstrate our attack against real-world ASRs that include DeepSpeech and Wav2Letter. Moreover, we employ a user study to verify that our method creates low audible distortion. Specifically, 80 of the 100 participants voted in favor of all our attack audio samples as less noisier than the existing state-of-the-art attack. Through this, we demonstrate both types of existing ASR pipelines can be exploited with minimum degradation to attack audio quality.
研究の動機と目的
- 信号処理に基づく特徴抽出を用いる従来型ASRにのみ効果を示す既存の心理音響攻撃の限界を是正すること。
- 従来型および完全にエンド・ツー・エンドのASRアーキテクチャの両方に効果的な統一された攻撃手法を開発すること。
- $L_p$クリッピングを心理音響的に情報のある摂動制約に置き換えることで、悪意ある例の音声品質を向上させること。
- ユーザー調査を用いて、悪意ある音声の知覚的品質を、最先端のCW攻撃と比較して検証すること。
- 適切な知覚モデリングが適用された場合、現代のエンド・ツー・エンドASRが心理音響攻撃に対して依然として脆弱であることを示すこと。
提案手法
- 攻撃は心理音響モデルを用いて周波数ドメインのマスキング閾値を計算し、悪意ある摂動の大きさを制約するために用いる。
- 摂動はSTFTを介して時間周波数ドメインで生成され、エネルギーがマスキング閾値以下に保たれるように等化が適用される。
- 時間領域と周波数領域を交互に切り替え、摂動後はGriffin-Limを用いて音声信号を再構築する。
- 反復的最適化を用いて摂動エネルギーを最小化しつつ、高いASR攻撃成功率を維持する。
- 同じフレームワークを用いて、従来型ASR(例:DeepSpeech)およびエンド・ツー・エンドモデル(例:Wav2Letter)の両方に対して攻撃を適用する。
- $L_p$クリッピング法は、人間の聴覚マスキングを考慮しないため、知覚的品質制御に不適切であることが示された。
実験結果
リサーチクエスチョン
- RQ1従来型および完全にエンド・ツー・エンドのASRシステムの両方に効果的な心理音響攻撃を設計できるか?
- RQ2マスキング閾値の使用と$L_p$クリッピングの間で、知覚的音声品質にどのような差が生じるか?
- RQ3等化に基づく摂動は、人間の聴取者にとってどれほど人間が感知できないままであるか?
- RQ4攻撃は、聴取可能な歪みを最小限に抑えつつ、現代のエンド・ツー・エンドASRに対して高い成功率を維持できるか?
- RQ5信号処理と心理音響学を統合した高品質な悪意ある例を生成するための統一された攻撃フレームワークを開発できるか?
主な発見
- 提案された等化に基づく攻撃は、従来型のDeepSpeech ASRモデルに対して100%の成功率を達成した。
- 完全にエンド・ツー・エンドのWav2Letterモデルに対しても76%の成功率を達成し、最先端の最適化ベースの攻撃と同等の性能を示した。
- 100名の参加者を対象としたユーザー調査では、80%の参加者が本手法のすべての悪意ある音声サンプルをCW攻撃のものよりもノイジーではないと評価した。
- 70%を超える参加者がCW攻撃の音声サンプルを不快(やや不快、不快、非常に不快)と感じた一方、本手法のサンプルは2–32%の参加者しか区別できないと感じなかった。
- $\chi^2$検定により、音声品質に統計的に有意な差(p < 0.01)があることが確認され、本手法が著しく低い聴取可能な歪みを生じることを裏付けた。
- 調査から、$L_p$クリッピングは人間の聴覚マスキングを考慮しないため、知覚的品質制御に不適切であることが明らかになった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。