Skip to main content
QUICK REVIEW

[논문 리뷰] Understanding Training-Data Leakage from Gradients in Neural Networks for Image Classification

Cangxiong Chen, Neill D. F. Campbell|arXiv (Cornell University)|2021. 11. 19.
Adversarial Robustness in Machine Learning인용 수 6
한 줄 요약

이 논문은 이미지 분류를 위한 딥 뉴럴 네트워크에서 기울기로부터 훈련 이미지를 복원하기 위한 새로운 방법인 COPA를 제안한다. 각 레이어의 가중치와 기울기를 사용하여 복원 문제를 선형 시스템으로 공식화함으로써, 특히 넓은 초기 합성곱 레이어를 포함한 아키텍처 설계가 데이터 泄漏 위험을 크게 증가시킨다는 점을 드러내며, 이러한 공격에 대한 모델의 취약도를 수량화하는 새로운 지표 $ c(M) $ 를 제안한다.

ABSTRACT

Federated learning of deep learning models for supervised tasks, e.g. image classification and segmentation, has found many applications: for example in human-in-the-loop tasks such as film post-production where it enables sharing of domain expertise of human artists in an efficient and effective fashion. In many such applications, we need to protect the training data from being leaked when gradients are shared in the training process due to IP or privacy concerns. Recent works have demonstrated that it is possible to reconstruct the training data from gradients for an image-classification model when its architecture is known. However, there is still an incomplete theoretical understanding of the efficacy and failure of such attacks. In this paper, we analyse the source of training-data leakage from gradients. We formulate the problem of training data reconstruction as solving an optimisation problem iteratively for each layer. The layer-wise objective function is primarily defined by weights and gradients from the current layer as well as the output from the reconstruction of the subsequent layer, but it might also involve a 'pull-back' constraint from the preceding layer. Training data can be reconstructed when we solve the problem backward from the output of the network through each layer. Based on this formulation, we are able to attribute the potential leakage of the training data in a deep network to its architecture. We also propose a metric to measure the level of security of a deep learning model against gradient-based attacks on the training data.

연구 동기 및 목표

  • 딥 뉴럴 네트워크에서 모델 기울기로부터 훈련 데이터가 어떻게 복원될 수 있는지 메커니즘을 이해하는 것.
  • 이전의 DLG나 R-GAP과 같은 방법을 넘어서, 합성곱 레이어에 적용 가능한 일반화 가능한 이론적 프레임워크를 개발하여 훈련 데이터 泄漏를 설명하는 것.
  • 공유된 기울기로부터의 데이터 복원 위험을 증가시키는 CNN 내 아키텍처적 요인을 규명하는 것.
  • 기울기 기반 복원 공격에 대한 모델의 보안성을 수량화하는 지표 $ c(M) $ 를 제안하는 것.
  • 아키텍처 선택과 泄漏 위험 간의 연관성을 연결하여, 더 사생활 보호에 유리한 딥 러닝 모델 설계를 이끄는 것.

제안 방법

  • COPA는 각 레이어에서 정방향 및 역방향 전파 방정식에서 유도된 선형 시스템을 해결하는 방식으로 복원 문제를 공식화한다.
  • 합성곱 가중치와 기울기의 순환 행렬 표현을 사용하여 가중치, 기울기, 활성화 간의 제약 조건을 표현한다.
  • 완전히 연결된 레이어의 경우, 가중치 공유가 없기 때문에 입력을 닫힌 형태로 복원할 수 있다.
  • 합성곱 레이어의 경우, 블록 행렬 $ U^{(i)} $ 와 $ V^{(i)} $ 를 사용하여 가중치와 기울기 제약 조건을 조합하여 이차 최적화 문제로 변환한다.
  • 이 방법은 더 깊은 레이어에서의 제약 조건을 역전파하여 $ Z^{(i)} $ 와 $ \nabla_{Z^{(i)}}J $ 를 추정함으로써 반복적인 복원을 가능하게 한다.
  • 복원 품질을 향상시키기 위해 후처리 단계로 Total Variation 노이즈 제거를 적용한다.

실험 결과

연구 질문

  • RQ1CNN의 어떤 아키텍처적 특성이 기울기로부터 훈련 이미지 복원에 취약하게 만드는가?
  • RQ2오직 기울기와 모델 아키텍처만을 사용하여 단일 훈련 이미지의 복원을 제약 최적화 문제로 어떻게 공식화할 수 있는가?
  • RQ3가중치 공유와 레이어별 차원이 기울기를 통한 데이터 泄漏를 가능하게 하거나 제한하는 데 어떤 역할을 하는가?
  • RQ4특히 합성곱 레이어에 대해, 다양한 레이어 유형 간 기울기 기반 데이터 泄漏를 설명할 수 있는 통합된 이론적 프레임워크를 개발할 수 있는가?
  • RQ5제안된 지표 $ c(M) $ 는 실질적인 복원 품질과 어떻게 상관관계를 가지는가?

주요 결과

  • COPA는 모델 아키텍처와 레이블 정보만을 사용하여 높은 정밀도로 훈련 이미지를 기울기로부터 성공적으로 복원한다.
  • 지표 $ c(M) $ 는 복원 품질과 강한 상관관계를 보이며, $ c(M) = 0 $ 인 모델은 완전히 복원 가능하다는 것이 CNN3 버전 1과 3에서 입증되었다.
  • CNN3 버전 1($ c(M) = -2267 $) 과 버전 3($ c(M) = 0 $) 는 버전 2와 4보다 훨씬 뛰어난 복원 품질을 보였다.
  • 버전 1과 3의 첫 번째 레이어가 지표에 기여도 0을 기록함($ \operatorname{rank}(U^{(1)}) = |X| $)하여, 해당 레이어에서 최대 수준의 泄漏 잠재력이 있음을 시사한다.
  • 더 깊은 레이어에서 유도된 피드백 제약 조건이 복원 품질에 미치는 영향은 제한적이었으며, 이는 초기 레이어의 아키텍처가 泄漏 위험을 주도한다는 것을 시사한다.
  • 제안된 지표 $ c(M) $ 는 모델의 COPA 유형 공격에 대한 취약도를 아키텍처 기반으로 신뢰성 있게 예측할 수 있으며, 사생활 보호를 위한 사전적 설계 선택을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.