Skip to main content
QUICK REVIEW

[論文レビュー] Benchmarking Differential Privacy and Federated Learning for BERT Models

Priyam Basu, Tiasa Singha Roy|arXiv (Cornell University)|Jun 26, 2021
Privacy-Preserving Technologies in Data参考文献 37被引用数 6
ひとこと要約

本稿は、うつ病および性的嫌がらせに関するTwitterデータセットを用いた、BERTベースのモデルにおける微分プライバシー(DP)およびフェデレーテッドラーニング(FL)のベンチマークを実施し、BERT、RoBERTa、ALBERT、DistilBERTの各モデルにおけるプライバシー・ユーティリティのトレードオフを評価している。結果として、ALBERTのような小型モデルはDP下でも劣化がなだらかに保たれ、非IIDデータを伴うFLではユーティリティの損失が顕著に増加するが、DP-FLはプライバシーの利点を兼ね備えつつ、モデルサイズやデータ分布に応じた明確な性能のトレードオフを示している。

ABSTRACT

Natural Language Processing (NLP) techniques can be applied to help with the diagnosis of medical conditions such as depression, using a collection of a person's utterances. Depression is a serious medical illness that can have adverse effects on how one feels, thinks, and acts, which can lead to emotional and physical problems. Due to the sensitive nature of such data, privacy measures need to be taken for handling and training models with such data. In this work, we study the effects that the application of Differential Privacy (DP) has, in both a centralized and a Federated Learning (FL) setup, on training contextualized language models (BERT, ALBERT, RoBERTa and DistilBERT). We offer insights on how to privately train NLP models and what architectures and setups provide more desirable privacy utility trade-offs. We envisage this work to be used in future healthcare and mental health studies to keep medical history private. Therefore, we provide an open-source implementation of this work.

研究の動機と目的

  • 微分プライバシー(DP)およびフェデレーテッドラーニング(FL)が精神保健分野のBERTベースのモデルのユーティリティに与える影響を評価すること。
  • 中央集権的およびフェデレーテッド学習におけるDPを適用した状況下で、異なるモデルアーキテクチャ(BERT、RoBERTa、ALBERT、DistilBERT)の間でのプライバシー・ユーティリティのトレードオフを比較すること。
  • データ分布(IID対非IID)が、DPを適用したFL環境下でのモデル性能に与える影響を分析すること。
  • 特に感受性の高い精神保健分野のデータを扱う際のプライバシー保護型NLPシステム設計に実証的知見を提供すること。
  • 再現可能なDPおよびFLのベンチマークを支援するオープンソースフレームワークを公開すること。

提案手法

  • 本研究では、Opacusを用いて、4つのBERTベースのアーキテクチャ全体にわたる学習プロセス中にノイズを注入することで微分プライバシーを実装している。
  • 中央集権的学習におけるDP評価は、2つのTwitterデータセット(うつ病および性的嫌がらせ)を対象とし、プライバシー予算(ε = 0.5, 5, 15, ∞)を変化させながら実施している。
  • フェデレーテッドラーニングは、10人のクライアントがデータの断片を保持するFedAvgを用いて実装されており、各学習ラウンドでクライアントごとにローカルにDPが適用されている。
  • IID(均等に分布したデータ)と非IID(非均等で現実的)の2つのFLデータ分布シナリオを評価しており、各クライアントに240件のサンプルを割り当てている。
  • モデル性能は、ホールドアウトされたテストセットにおけるテスト精度で測定され、3回のランダムシードによる平均化と標準偏差を併記して報告されている。
  • 再現可能性およびNLP分野におけるDPおよびFLの今後のベンチマークを可能にするために、オープンソースフレームワークを公開している。

実験結果

リサーチクエスチョン

  • RQ1微分プライバシーは、精神保健分野のテキスト分類を目的とした中央集権的学習におけるBERTベースのモデルのユーティリティにどのように影響を与えるか?
  • RQ2DP下でのプライバシー・ユーティリティのトレードオフにおいて、モデルアーキテクチャ(例:BERT対ALBERT)の違いはどのように比較されるか?
  • RQ3IID対非IIDのデータ分布が、DPを適用したフェデレーテッドラーニングにおけるモデルユーティリティに与える影響は何か?
  • RQ4DPとフェデレーテッドラーニングを組み合わせたDP-FLは、DPまたはFL単体と比較して、モデル性能にどのように影響を与えるか?
  • RQ5医療分野のNLPモデルにおいて、ユーティリティとプライバシーのバランスを取る最適なプライバシー予算(ε)は何か?

主な発見

  • ALBERT や DistilBERT のような小型モデルは、BERT や RoBERTa のような大型モデルと比較して、微分プライバシー下でも劣化がなだらかに保たれ、より優れたプライバシー・ユーティリティのトレードオフを示している。
  • 非IIDのFL環境(現実的な医療データ分布を反映)では、IID環境と比較して平均してより高いユーティリティの劣化が見られ、特化したトレーニングアルゴリズムの必要性が示唆された。
  • うつ病データセットにおいて、RoBERTa はDPを適用しない状態で最高のベースライン精度(83.56 ± 0.00)を達成したが、DP適用時においてもALBERTが最も小さな性能低下を示した。
  • DPとFLを組み合わせた場合、非IIDのFL環境下でBERTが最高のテスト精度(72.44 ± 1.74)を達成したが、これは非プライベートなFLベースライン(76.28 ± 0.11)を下回っている。
  • εを0.5から15に増加させると、テスト精度の標準偏差が減少し、非プライベートベースラインに近づく安定した性能が得られることを示した。
  • 限られた訓練データでは、DPがモデルのユーティリティに与える悪影響が顕著に現れ、特にデータが少ない状況下で顕著であった。これは、DPノイズに対するデータ感受性が高いため、先行研究の結果を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。