Skip to main content
QUICK REVIEW

[論文レビュー] Privacy-Preserving Graph Convolutional Networks for Text Classification

Timour Igamberdiev, Ivan Habernal|TUbilio (Technical University of Darmstadt)|Feb 10, 2021
Privacy-Preserving Technologies in Data参考文献 37被引用数 5
ひとこと要約

本稿では、テキスト分類におけるグラフ畳み込みネットワーク(GCN)のプライバシー保護フレームワークを提案する。微分プライバシー確立された勾配降下法(SGD-DP)の適応と、新規の微分プライバシー確立されたAdam最適化手法(Adam-DP)の導入により、プライバシーと性能のトレードオフを向上させるためにランダムなグラフ分割を採用している。複数の英語およびスロバキア語NLPデータセットにおいて、ε=1.0で強力なプライバシー保証を達成しながら、非プライベートのF₁スコアの最大90%を達成している。

ABSTRACT

Graph convolutional networks (GCNs) are a powerful architecture for representation learning on documents that naturally occur as graphs, e.g., citation or social networks. However, sensitive personal information, such as documents with people's profiles or relationships as edges, are prone to privacy leaks, as the trained model might reveal the original input. Although differential privacy (DP) offers a well-founded privacy-preserving framework, GCNs pose theoretical and practical challenges due to their training specifics. We address these challenges by adapting differentially-private gradient-based training to GCNs and conduct experiments using two optimizers on five NLP datasets in two languages. We propose a simple yet efficient method based on random graph splits that not only improves the baseline privacy bounds by a factor of 2.7 while retaining competitive F1 scores, but also provides strong privacy guarantees of epsilon = 1.0. We show that, under certain modeling choices, privacy-preserving GCNs perform up to 90% of their non-private variants, while formally guaranteeing strong privacy measures.

研究の動機と目的

  • テキスト分類に用いられるグラフ畳み込みネットワーク(GCN)において、ノードのテキストとグラフ構造の両方が機微な情報を露呈する可能性があるというプライバシー漏洩の問題に対処すること。
  • 非i.i.d.データとグラフ構造の依存関係があるため、GCNにおいては体系的でないが、微分プライバシー(DP)最適化手法(特にSGD-DPとAdam-DP)を適応すること。
  • グラフ分割と高度な入力表現が、GCNにおけるDPノイズによって引き起こされる性能低下を緩和できるかどうかを調査すること。
  • 2言語(英語とスロバキア語)の多様なNLPデータセットを用いて、プライバシーと性能のトレードオフを実証的に評価し、モデルの有用性を損なわず強力なプライバシー保証を実現すること。

提案手法

  • 元のグラフをサブグラフに分割するランダムなグラフ分割戦略を提案し、DP訓練中の感度を低減させ、元のデータへの追加クエリを回避する。
  • GCNに微分プライバシー確立された勾配降下法(SGD-DP)を適応させるために、グラフベースのデータ依存性を考慮した勾配クリッピングとノイズ注入手順を変更する。
  • 収束性を向上させ、訓練エポック数を削減することでプライバシーと性能のトレードオフを改善する、Adam最適化手法の微分プライバシー版(Adam-DP)を導入する。
  • BoWやfastTextからBERT埋め込みまで、多様な入力表現を用いて、それらがDP性能に与える影響を評価する。
  • 固定されたプライバシー予算(ε=1.0)を用いて微分プライバシーを適用し、複数のデータセットと最適化手法におけるF₁スコアを評価する。
  • 引用ネットワーク、ソーシャルメディア、ユーザ関心分類を含む5つのNLPデータセット(Cora、Citeseer、PubMed、Reddit、Pokec)を用いて、標準化された評価プロトコルを適用する。

実験結果

リサーチクエスチョン

  • RQ1非i.i.d.データ構造とグラフ依存性を有するGCNに、微分プライバシー訓練を効果的に適用できるか?
  • RQ2標準的なDP訓練と比較して、グラフ分割はGCNにおけるプライバシーと性能のトレードオフを改善するか?
  • RQ3異なる最適化手法(SGD-DP対Adam-DP)は、GCNにおけるDP制約下でのモデル性能にどのように影響するか?
  • RQ4複雑な入力表現(例:BERT)は、GCNにおけるDPノイズによって引き起こされる性能低下をどの程度軽減できるか?
  • RQ5強力なプライバシー保証(ε=1.0)を維持しつつ、テキスト分類におけるGCNで高いモデル有用性を達成できるか?

主な発見

  • 提案されたグラフ分割法により、すべてのデータセットでベースラインのプライバシー境界が2.7倍向上し、競争力のあるF₁スコアを維持した。
  • グラフ分割とBERT埋め込みを組み合わせることで、ε=1.0の下で非プライベートF₁スコアの最大90%を達成し、優れた性能保持が確認された。
  • Adam-DPは、特に複雑な入力特徴と組み合わせた場合、収束が速くエポック数が少ないため、SGD-DPよりもプライバシーと性能のトレードオフにおいて優れた性能を示した。
  • より洗練された入力表現(例:BERT)は、DP下での性能低下を小さくし、BERTベースのモデルでは最小の低下(例:Adam-DPでε=2.0のときF₁=0.84)を示した。
  • BoW表現はDP下で最大の性能低下を示した(例:SGD-DPでε=2.0のときF₁=0.62)、シンプルな特徴がDPノイズに対してより脆弱であることが確認された。
  • すべてのデータセットで強力なプライバシー保証(ε=1.0)を達成しており、ソーシャルネットワークやユーザ関心プロファイルなど、本質的に機微なデータを含むデータセットでも同様に有効であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。