Skip to main content
QUICK REVIEW

[論文レビュー] Perceptual Based Adversarial Audio Attacks

Joseph Szurley, J. Zico Kolter|arXiv (Cornell University)|Jun 14, 2019
Adversarial Robustness in Machine LearningComputer Science参考文献 25被引用数 18
ひとこと要約

本稿では、心理音響的マスキングを活用して時間領域で人間の聴取に感知されない摂動を生成する、知覚的に根拠付けられ、物理的に実現可能な敵対的音声攻撃を提案する。PESQを用いた知覚的品質最適化と合成された部屋インパulse応答による耐性強化により、敵対的攻撃の成功を最適化した結果、言語モデルデコーダーを用いた空中伝送テストにおいて、劣化したSNR条件下でも0%のWERおよびCERを達成した。

ABSTRACT

Recent work has shown the possibility of adversarial attacks on automatic speechrecognition (ASR) systems. However, in the vast majority of work in this area, theattacks have been executed only in the digital space, or have involved short phrasesand static room settings. In this paper, we demonstrate a physically realizableaudio adversarial attack. We base our approach specifically on a psychoacoustic-property-based loss function, and automated generation of room impulse responses, to create adversarial attacks that are robust when played over a speaker in multiple environments. We show that such attacks are possible even while being virtually imperceptible to listeners.

研究の動機と目的

  • 人間の聴取に感知されないまま、自動音声認識(ASR)システムをだますことができる物理的に実現可能な敵対的音声攻撃を開発すること。
  • 周波数ドメインでのバックプロパゲーションに依存せずに、心理的マスキング閾値を敵対的最適化プロセスに統合し、知覚的歪みを低減すること。
  • 攻撃生成時に合成された部屋インパulse応答を組み込むことで、空中伝送状態における敵対的例の耐性を確保すること。
  • 主観的聴取テストに依存しないように、PESQスコアを知覚的品質の客観的指標として用いること。
  • 多重話者環境や変動するSNR状況を含む、現実的な物理環境で攻撃を評価し、実世界への実現可能性を示すこと。

提案手法

  • 本手法は、DFT対称性を用いて周波数ドメイン表現から心理的マスキング閾値を抽出することで、不安定な周波数ドメインでのバックプロパゲーションを回避し、時間ドメインで敵対的攻撃を定式化する。
  • $ l_2 $-ノルム制約付きの最適化を投影勾配降下法で実行し、ASRの誤分類を最大化すると同時に知覚的歪みを最小化する敵対的摂動を生成する。
  • 知覚的品質は、人間の聴取テストの代理として、音声品質の知覚的評価(PESQ)スコアを用いて最適化する。
  • 空中伝送の影響を模擬するために、攻撃合成時に合成された部屋インパulse応答を生成・適用し、耐性を向上させる。
  • 信号対雑音比(SNR)の変動する条件下で、誤り率を評価するために、グリーディおよび言語モデルベースのASRデコーダーを用いて攻撃を評価する。
  • アネクソイック環境および多重話者環境(4インチのスピーカー間隔、6インチのマイク距離)を含む、物理的耐性をテストするための検証を実施した。

実験結果

リサーチクエスチョン

  • RQ1心理的マスキング原理を用いることで、物理的に実現可能で人間の聴取に感知されない敵対的音声攻撃を実現できるか?
  • RQ2PESQのような知覚的品質指標を統合することで、敵対的音声攻撃の効果性と現実性はどのように向上するか?
  • RQ3合成された部屋インパulse応答は、空中伝送におけるASR攻撃の敵対的例の耐性をどの程度向上させるか?
  • RQ4グリーディデコーダーと言語モデルデコーダーの異なるASRデコーディング戦略は、変動するSNR条件下での攻撃成功率にどのような影響を及えるか?
  • RQ5知覚的に最適化された敵対的例は、クリッピングやパスロスなどの物理的歪みに対しても高い攻撃成功率を維持できるか?

主な発見

  • 言語モデルデコーダーを用いた2人話者空中伝送環境(平均SNR 66.7 dBA)において、4回の試行のうち3回で語誤り率(WER)が0%、文字誤り率(CER)が0%を達成した。
  • SNR 60–70 dBAの条件下で、言語モデルデコーダーはWER=4.0、CER=2.4を達成したのに対し、グリーディデコーダーはWER=3.0、CER=2.25を達成し、言語モデルによる耐性向上が確認された。
  • 攻撃に起因する摂動にもかかわらず、PESQスコアが向上しており、心理的損失の有効性が裏付けられた。
  • 高SNR条件下でのクリッピング(信号振幅がマイクの上限を超えることによる)が、WERとCERを顕著に増加させたことから、物理的展開における振幅制御の重要性が示された。
  • 本手法は、知覚的に感知されず、アネクソイック部屋や多重話者環境を含む複数の物理的環境で耐性を示す敵対的例を成功裏に生成した。
  • 物理的チャネル効果下でも優れた一般化性能を示し、スピーカーとマイク間の距離が増加するに従いSNRが低下しても、性能が安定したまま維持された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。