Skip to main content
QUICK REVIEW

[論文レビュー] Robust Federated Learning Against Adversarial Attacks for Speech Emotion Recognition

Yi Chang, Sofiane Laridi|arXiv (Cornell University)|Mar 9, 2022
Adversarial Robustness in Machine Learning被引用数 13
ひとこと要約

本稿は、データの機微性を保つためにフェデレーテッド・ラーニングを活用し、訓練段階で adversarial training、推論段階でランダム化を行う二段階防御を組み合わせることで、ホワイトボックス攻撃に対して強力なモデルの耐性を向上させる、音声感情認識のための新規フェデレーテッド・アドバーシャル・ラーニングフレームワークを提案する。このアプローチは、FGSM攻撃下で90.15%の未加重平均再現率を達成し、より強力な反復的DeepFool攻撃下では72.32%を記録し、アンタッチャブルなフェデレーテッド・ラーニングを著しく上回る性能を示した。

ABSTRACT

Due to the development of machine learning and speech processing, speech emotion recognition has been a popular research topic in recent years. However, the speech data cannot be protected when it is uploaded and processed on servers in the internet-of-things applications of speech emotion recognition. Furthermore, deep neural networks have proven to be vulnerable to human-indistinguishable adversarial perturbations. The adversarial attacks generated from the perturbations may result in deep neural networks wrongly predicting the emotional states. We propose a novel federated adversarial learning framework for protecting both data and deep neural networks. The proposed framework consists of i) federated learning for data privacy, and ii) adversarial training at the training stage and randomisation at the testing stage for model robustness. The experiments show that our proposed framework can effectively protect the speech data locally and improve the model robustness against a series of adversarial attacks.

研究の動機と目的

  • エッジデバイス上でユーザーの音声データをローカルに保つことで、音声感情認識(SER)におけるデータの機微性に関する懸念を軽減するため、フェデレーテッド・ラーニングを活用する。
  • 中央集権的なデータ共有に依存せずに、特に移行可能で反復的な攻撃を含むホワイトボックスアドバーシャル攻撃に対してモデルの耐性を向上させる。
  • フェデレーテッド・ラーニング環境下で、単一段階の防御(アドバーシャル・トレーニングまたはランダム化)およびその組み合わせの有効性を評価する。
  • ログメルスペクトログ램におけるランダム化が、DeepFoolのような強力な反復的攻撃に対して特に効果的であることを示す。
  • 実世界のエッジベース応用において、プライバシーを守りつつ耐性のあるSERの包括的で包括的なパイプラインを確立する。

提案手法

  • フェデレーテッド・ラーニングを用いて、生の音声データを共有せずにグローバルモデルを訓練することで、エッジデバイス上にローカルデータを保持することによりデータの機微性を確保する。
  • アドバーシャル・トレーニングを訓練段階で実施し、FGSMおよびPGD攻撃によって生成されたアドバーシャル例を用いることで、単一ステップ攻撃に対する耐性を向上させる。
  • 推論段階でランダム化を適用し、ログメルスペクトログラムをランダムな割合でリサイズおよびパディングすることで、アドバーシャル摂動を攪乱する。
  • 二段階防御戦略として、アドバーシャル・トレーニングとランダム化を組み合わせることで、移行可能で反復的な攻撃の両方に対する耐性を強化する。
  • SERにVGG-15アーキテクチャを用い、クライアント・サーバー型フェデレーテッド・ラーニング環境でFedAvgを用いてモデル更新を集約する。
  • 実験は、現実的なフェデレーテッド・ラーニングの制約を反映させるために、話者に依存するデータ分割を用いたEMAデータベース上で実施する。

実験結果

リサーチクエスチョン

  • RQ1フェデレーテッド・ラーニングを用いることで、音声感情認識におけるデータの機微性を効果的に保護しつつ、共同でのモデル学習を可能にすることができるか?
  • RQ2フェデレーテッド・ラーニング環境下で、単一ステップのアドバーシャル攻撃(例:FGSM)に対するアドバーシャル・トレーニングの有効性はどの程度か?
  • RQ3推論段階でのランダム化は、より強力な反復的アドバーシャル攻撃(例:DeepFool)に対するフェデレーテッドSERモデルの耐性を向上させることができるか?
  • RQ4アドバーシャル・トレーニングとランダム化を組み合わせることで、フェデレーテッド・ラーニング環境下で単一段階の防御よりも顕著に耐性が向上するか?
  • RQ5特に攻撃アルゴリズムが異なる場合に、生成されたアドバーシャル例を用いた移行可能攻撃において、提案フレームワークの性能はいかがであるか?

主な発見

  • アドバーシャル・トレーニングに続くランダム化という二段階防御は、FGSM攻撃下のアドバーシャルテストデータで90.15%の未加重平均再現率を達成し、単一段階の防御を上回った。
  • より強力な反復的DeepFool攻撃下では、組み合わせ防御が72.32%の未加重平均再現率を達成し、複雑な摂動に対しても強い耐性を示した。
  • ランダム化は、反復的攻撃に対する防御において、アドバーシャル・トレーニング単体よりも効果的であった。これは、こうした攻撃が特定のモデルパラメータに過剰適合しやすい性質に起因する可能性がある。
  • アドバーシャル・トレーニングは、反復的攻撃(例:DeepFool)に対しては単一ステップ攻撃(例:FGSM)に対して比べて防御効果が劣ることから、一般化能力の限界が示された。
  • 特に高移行性および反復的攻撃のシナリオにおいて、ヴァナイルなフェデレーテッド・ラーニングと比較して、モデルの耐性が著しく向上した。
  • 実験における話者に依存するデータ分割は、現実のフェデレーテッド・ラーニングの制約を反映しており、その結果、本フレームワークがこうした現実的な条件下でも効果を発揮することが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。