Skip to main content
QUICK REVIEW

[論文レビュー] PBSM: Backdoor attack against Keyword spotting based on pitch boosting and sound masking

Hanbo Cai, Pengcheng Zhang|arXiv (Cornell University)|Nov 16, 2022
Speech Recognition and Synthesis被引用数 5
ひとこと要約

本稿では、周波数ブースティングと音声マスキングを用いて、聴取不能で効果的なトリガーを生成する、キーワードスポット(KWS)向けの巧妙なバックドア攻撃であるPBSMを提案する。時間的(周波数)および空間的(振幅)特徴を併用することで、1%未満の汚染訓練データで90%を超える攻撃成功率を達成し、多様なKWSモデルにおいて、従来手法を上回る巧妙さと耐性を実現した。

ABSTRACT

Keyword spotting (KWS) has been widely used in various speech control scenarios. The training of KWS is usually based on deep neural networks and requires a large amount of data. Manufacturers often use third-party data to train KWS. However, deep neural networks are not sufficiently interpretable to manufacturers, and attackers can manipulate third-party training data to plant backdoors during the model training. An effective backdoor attack can force the model to make specified judgments under certain conditions, i.e., triggers. In this paper, we design a backdoor attack scheme based on Pitch Boosting and Sound Masking for KWS, called PBSM. Experimental results demonstrated that PBSM is feasible to achieve an average attack success rate close to 90% in three victim models when poisoning less than 1% of the training data.

研究の動機と目的

  • キーワードスポット(KWS)システムにおいて、効果的で巧妙なバックドア攻撃が不足している問題に対処すること。
  • 従来のトリガーには、音声として聴取可能であるか、サンプリングレートの制約があるという限界があることに対処すること。
  • 人間が感知できないが、多様なKWSモデルで高い攻撃成功率を維持できるバックドアトリガーを設計すること。
  • 正常な入力に対するモデルの精度に最小限の影響を与えることで、攻撃後のモデルの有用性を保つこと。

提案手法

  • 本手法は、LSTMなどの時間的モデルに効果的であるように、音声の全体的な周波数特性を変更する周波数ブースティングを組み合わせる。
  • 短時間で高振幅の信号を、マスキング音によって覆い隠すことで、人間の知覚を低減する。
  • 音響マスキングを利用し、高振幅信号の検出可能性を抑える。
  • トリガー生成フェーズでは、フーリエ変換を用いて音声を周波数領域に変換し、周波数をブーストすることでバックドアを埋め込む。
  • 汚染訓練フェーズでは、訓練データの1%未満にのみ改ざんされたトリガーを統合し、モデルを汚染する。
  • 本手法はサンプリングレートに依存しないため、40kHz以上の高サンプリングレートを必要とするモデルに対しても効果的に攻撃可能(例:超音波トリガーが必要なモデル)。

実験結果

リサーチクエスチョン

  • RQ1人間が聴取できないが、KWSモデルの攻撃に効果的なバックドアトリガーを設計できるか?
  • RQ2異なるKWSアーキテクチャ(CNNやLSTMを含む)において、低汚染率でも高い攻撃成功率を維持できるか?
  • RQ3周波数ブースティングと音声マスキングを組み合わせることで、単一トリガー手法に比べて、巧妙さと効果性が向上するか?
  • RQ4バックドアが仕込まれたモデルが、正常な入力に対してどれほど高い精度を維持できるか(性能劣化の程度)?

主な発見

  • PBSMは、訓練データの1%未満を汚染した場合でも、3つの被害者KWSモデルにおいて平均90%を超える攻撃成功率を達成した。
  • 汚染率が低い(≤1%)場合でも、PBSMの攻撃成功率は一貫して高く維持され、特にLSTMベースのモデルでは、ベースラインの超音波パルストリガーを上回った。
  • 正常な入力に対する平均精度のばらつきはたったの0.64%であり、モデル性能の劣化が最小限に抑えられていることが示された。
  • 人間評価では、95%の被験者がバックドアが仕込まれた音声を自然で理解可能と評価し、高振幅のトリガー成分を認識しなかった。
  • 本手法はCNNおよびLSTMベースのモデルの両方で有効であり、周波数ブースティングが順序付きモデルにおける攻撃成功率を向上させること、音声マスキングが巧妙さを高めることを示した。
  • 本手法はサンプリングレートに依存しないため、超音波トリガーがサンプリングレート不足のため失敗するモデルに対しても効果を発揮した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。