[논문 리뷰] Towards Representation Identical Privacy-Preserving Graph Neural Network via Split Learning
이 논문은 수평 분할된 그래프 데이터에서 원시 데이터를 공유하지 않고도 노드 분류를 가능하게 하는 프라이버시 보장 그래프 신경망 프레임워크인 SAPGNN을 제안한다. 로컬 클라이언트와 준신뢰성 서버 사이에서 GNN 레이어를 분할하고, 보안 풀링 메커니즘을 적용함으로써 SAPGNN은 중심화된 학습에서 얻은 것과 동일한 노드 임베딩을 달성하며, 상태 기반 성능을 유지하거나 초월한다. 특히 근접한 I.I.D. 레이블 분포 조건에서 뛰어난 성능을 보인다.
In recent years, the fast rise in number of studies on graph neural network (GNN) has put it from the theories research to reality application stage. Despite the encouraging performance achieved by GNN, less attention has been paid to the privacy-preserving training and inference over distributed graph data in the related literature. Due to the particularity of graph structure, it is challenging to extend the existing private learning framework to GNN. Motivated by the idea of split learning, we propose a extbf{S}erver extbf{A}ided extbf{P}rivacy-preserving extbf{GNN} (SAPGNN) for the node level task on horizontally partitioned cross-silo scenario. It offers a natural extension of centralized GNN to isolated graph with max/min pooling aggregation, while guaranteeing that all the private data involved in computation still stays at local data holders. To further enhancing the data privacy, a secure pooling aggregation mechanism is proposed. Theoretical and experimental results show that the proposed model achieves the same accuracy as the one learned over the combined data.
연구 동기 및 목표
- 분산 환경에서 수평 분할된 그래프 데이터에 대한 프라이버시 보장 GNN 프레임워크의 부족을 해결하기 위해.
- 개인 정보가 포함된 노드 및 엣지 데이터가 로컬 클라이언트에 유지되는 조건에서 공동 GNN 학습을 가능하게 하여 데이터 공유를 방지하기 위해.
- 최종 노드 표현이 중심화된 그래프에서 학습된 것과 동일하도록 보장하여 모델 무결성을 유지하기 위해.
- 준신뢰성 서버로부터 로컬 임베딩을 보호하기 위해 보안 풀링 집계 메커니즘을 통해 프라이버시를 강화하기 위해.
- 레이블 분포 기울기의 변화에 따라 성능을 평가하고, 특히 비I.I.D. 상황에서의 성능을 분석하기 위해.
제안 방법
- 데이터 소유자에 있는 로컬 모델과 준신뢰성 서버에 있는 글로벌 모델으로 각 GNN 레이어를 분할하여 데이터 프라이버시를 유지한다.
- 최대/최소 풀링 집계를 사용하여 개별 로컬 임베딩을 드러내지 않고도 글로벌 임베딩을 계산할 수 있도록 한다.
- 서버가 원시 로컬 임베딩을 노출하지 않도록 하는 보안 풀링 메커니즘을 설계하여 준신뢰성 공격자에 대한 저항력을 강화한다.
- 데이터 소유자 간에 겹치는 노드와 엣지를 유지함으로써 서브그래프 간 메시지 전달을 가능하게 한다.
- 원시 특성 또는 레이블이 아닌 암호화되거나 집계된 표현만을 사용하여 글로벌 모델을 학습한다.
- 레이어 간 집계 및 업데이트 함수를 정렬함으로써 최종 노드 표현이 중심화된 GNN에서 얻은 것과 동일하게 보장한다.
실험 결과
연구 질문
- RQ1수평 분할된 그래프 데이터에 대해 중심화된 GNN에서 얻은 것과 동일한 노드 표현을 유지하는 프라이버시 보장 GNN 프레임워크를 설계할 수 있는가?
- RQ2분할 학습이 그래프 신경망에 어떻게 적용되어야 하며, 데이터 프라이버시를 보장하면서도 모델 정확도를 유지할 수 있는가?
- RQ3레이블 분포 기울기(I.I.D. 대비 비I.I.D.)가 분산 GNN 학습 성능에 미치는 영향은 무엇인가?
- RQ4보안 풀링 메커니즘이 준신뢰성 위협 모델에서 서버가 민감한 로컬 임베딩을 유추하는 것을 방지할 수 있는가?
- RQ5다양한 데이터 분할 및 레이블 분포 설정에서 기존 방법(PGNN 및 SP)과 비교해 SAPGNN의 정확도 및 내구성은 어떠한가?
주요 결과
- SAPGNN은 중심화된 그래프에서 학습된 것과 동일한 노드 임베딩을 달성하여 모델의 정확성을 보장한다.
- Cora 및 Citeseer에서 SAPGNN은 PPGNN의 성능을 따라하거나 초월하며, 특히 근접한 I.I.D. 레이블 분포 조건(q ≥ 25%)에서 뛰어난 성능을 보인다.
- 레이블 분포가 극도로 기울어져 있을 경우(q = 0%), PPGNN이 SAPGNN를 능가하므로, SAPGNN의 장점은 균형 잡힌 레이블 조건에서 가장 두드러진다.
- SAPGNN은 SP 기반선보다 일관되게 뛰어나며, 데이터 소유자 수가 증가할수록 성능 격차가 더욱 벌어진다.
- 보안 풀링 메커니즘이 준신뢰성 서버로부터 로컬 임베딩을 효과적으로 보호하여 프라이버시를 강화하면서도 모델 정확도를 손상시키지 않는다.
- 클래스 간 엣지를 제거하면 Citeseer에서 Cora 또는 Pubmed보다 성능 저하가 더 심하게 나타나, 데이터셋에 따라 구조적 분할에 민감도가 다름을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.