Skip to main content
QUICK REVIEW

[論文レビュー] Certified Graph Unlearning

Eli Chien, Chao Pan|arXiv (Cornell University)|Jun 18, 2022
Advanced Graph Neural Networks被引用数 5
ひとこと要約

本論文は、グラフニューラルネットワーク(GNN)のための、最初の認証可能グラフアンラーニングフレームワークを紹介する。このフレームワークにより、ノード、エッジ、または特徴量の削除を provably correct に実行しつつ、モデルの性能を維持できる。解析的アンラーニングを一般化されたページランク(GPR)とシンプルグラフ畳み込み(SGC)を用いて実現し、Coraで20%のノードをアンラーニングした場合、再訓練と比較して0.1%の精度損失に抑えられ、4倍の高速化を達成。非グラフに配慮した手法と比較して12%高い精度を達成し、類似した計算複雑度を維持する。

ABSTRACT

Graph-structured data is ubiquitous in practice and often processed using graph neural networks (GNNs). With the adoption of recent laws ensuring the ``right to be forgotten'', the problem of graph data removal has become of significant importance. To address the problem, we introduce the first known framework for \emph{certified graph unlearning} of GNNs. In contrast to standard machine unlearning, new analytical and heuristic unlearning challenges arise when dealing with complex graph data. First, three different types of unlearning requests need to be considered, including node feature, edge and node unlearning. Second, to establish provable performance guarantees, one needs to address challenges associated with feature mixing during propagation. The underlying analysis is illustrated on the example of simple graph convolutions (SGC) and their generalized PageRank (GPR) extensions, thereby laying the theoretical foundation for certified unlearning of GNNs. Our empirical studies on six benchmark datasets demonstrate excellent performance-complexity trade-offs when compared to complete retraining methods and approaches that do not leverage graph information. For example, when unlearning $20\%$ of the nodes on the Cora dataset, our approach suffers only a $0.1\%$ loss in test accuracy while offering a $4$-fold speed-up compared to complete retraining. Our scheme also outperforms unlearning methods that do not leverage graph information with a $12\%$ increase in test accuracy for a comparable time complexity.

研究の動機と目的

  • プライバシー法(例:忘れられる権利)におけるグラフ構造データのデータ削除ニーズの増大に対処する。
  • メッセージパッシングによる特徴量の混合といった、グラフデータにおけるアンラーニングの独自の課題を形式化し、解決する。
  • 完全な再トレーニングなしに、アンラーニング後のモデル性能を保証する認証可能なアンラーニングフレームワークを開発する。
  • 標準的な機械学習を超えて、GNNにおけるノード、エッジ、特徴量レベルの削除を含むアンラーニングを拡張する。
  • SGCおよびGPRモデルを用いたGNNにおける認証可能アンラーニングの理論的基盤を確立する。

提案手法

  • データ削除後にGNN重みを解析的に修正する認証可能なアンラーニングフレームワークを提案し、完全な再トレーニングを回避する。
  • メッセージパッシングをモデル化し、閉形式のアンラーニング更新を可能にするために、一般化されたページランク(GPR)層を基盤として用いる。
  • GPRおよびSGCのスペクトル的性質を活用して、ノード、エッジ、特徴量削除のための解析的アンラーニングルールを導出する。
  • 摂動に基づく解析を用いて、アンラーニングがモデル性能を証明可能な範囲内に保つことを保証する。
  • 二段階のアプローチを採用:第一に、グラフ構造を用いてアンラーニング更新を計算する。第二に、それらをモデル重みに適用してデータ削除を反映する。
  • SGCおよびGPRモデルを用いて、6つのベンチマークデータセット上で手法を検証し、効率性と精度の維持を実証した。

実験結果

リサーチクエスチョン

  • RQ1特定のノード、エッジ、または特徴量を学習データから削除した後、GNNモデルが正確に保たれることを形式的に認証できるか?
  • RQ2グラフ構造における複雑な特徴量伝搬を考慮すると、完全な再トレーニングなしにGNNでどのようにアンラーニングを達成できるか?
  • RQ3特にSGCおよびGPRモデルに対して、証明可能なアンラーニング更新を導出するための解析的手法は何か?
  • RQ4グラフ構造に配慮したアンラーニングは、非グラフに配慮した手法と比較して、精度および効率性の面でどのように異なるか?
  • RQ5異なるアンラーニングシナリオにおいて、アンラーニング精度、計算コスト、モデル性能のトレードオフはどのようなものか?

主な発見

  • Coraデータセットにおいて、20%のノードをアンラーニングした場合、テスト精度がたった0.1%低下するにとどまり、性能劣化が最小限であることが示された。
  • 提案手法は、完全な再トレーニングと比較して4倍の高速化を達成し、大幅に効率性が向上した。
  • 時間的複雑度が類似するにもかかわらず、非グラフに配慮したアンラーニング手法と比較して、テスト精度で12%高い性能を示した。
  • フレームワークは、ノード、エッジ、特徴量削除という3つの異なるアンラーニングタイプを、証明可能な保証とともに効果的に処理できた。
  • 6つのベンチマークデータセットにおける実験結果は、強力な性能-複雑度のトレードオフを確認し、理論的基盤の妥当性を裏付けた。
  • GPRおよびSGCモデルの使用により、閉形式のアンラーニング更新が可能となり、この手法は効率的かつ認証可能であることが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。