Skip to main content
QUICK REVIEW

[논문 리뷰] Differentially Private Continual Learning

Sebastian Farquhar, Yarin Gal|arXiv (Cornell University)|2019. 02. 18.
Privacy-Preserving Technologies in Data참고 문헌 17인용 수 6
한 줄 요약

이 논문은 민감한 데이터를 저장하지 않고도 지속적 학습에서 지식을 유지할 수 있도록, 기록된 이력 데이터의 가능도를 추정하기 위해 개인정보 보호 기능을 갖춘 생성 모델(dP-GANs)을 사용하는 비밀 보장 지속적 학습 프레임워크인 DP-VGER을 제안한다. 강력한 개인정보 보호 보장을 제공하지만, GAN 훈련에서 공공 데이터를 제거할 경우 성능이 크게 떨어지며, 이는 개인정보 보호와 유용성 사이의 상충 관계를 드러낸다.

ABSTRACT

Catastrophic forgetting can be a significant problem for institutions that must delete historic data for privacy reasons. For example, hospitals might not be able to retain patient data permanently. But neural networks trained on recent data alone will tend to forget lessons learned on old data. We present a differentially private continual learning framework based on variational inference. We estimate the likelihood of past data given the current model using differentially private generative models of old datasets.

연구 동기 및 목표

  • 기본적으로 개인정보 보호 이유로 이력 데이터를 삭제해야 하는 지속적 학습에서 치명적인 잊음 문제를 해결하기 위해.
  • 과거 작업의 민감한 훈련 데이터를 저장하지 않으면서도 모델 성능을 유지하는 프레임워크를 개발하기 위해.
  • 지속적 학습에서 경험 재생에 사용되는 생성 모델에 비밀 보장 기능을 통합하기 위해.
  • 지속적 학습 환경에서 비밀 보장 수준과 모델 정확도 사이의 상호 관계를 평가하기 위해.

제안 방법

  • 과거 작업의 개인정보 비용이 누적되지 않도록 고정된 사전 분포와 작업별 가능도 항목을 사용하는 변분 추론을 적용한다.
  • 과거 데이터에서 훈련된 생성 모델(GANs)을 활용해 이전 데이터 분포의 가능도를 추정하고, 이를 현재 작업 데이터에 증강하는 데 사용한다.
  • Zhang 등(2018)의 dp-GAN 프레임워크를 적용하여 기울기 클리핑과 가우시안 노이즈를 사용해 GAN 훈련 중 (ε,δ)-비밀 보장 성질을 확보한다.
  • 훈련 안정성을 높이기 위해 각 데이터셋의 소량(1%)을 '공공 데이터'로 사용해 GAN을 훈련하고, 이후 이를 완전히 제거하여 순수한 비밀 보장 성능을 테스트한다.
  • 변분 자유 에너지의 계산이 불가능한 로그 가능도 항목을 생성 모델에서 유도한 몬테카를로 추정치로 대체하여 지속적 학습을 가능하게 한다.
  • 모든 작업에 대해 단일 출력 헤드를 사용하여 다중 출력 헤드 접근 방식과 구별되며, Split MNIST에서 성능을 평가한다.

실험 결과

연구 질문

  • RQ1비밀 보장 생성 모델이 저장된 이력 데이터를 효과적으로 대체할 수 있는가? 성능 저하 없이 지속적 학습에서 성능을 유지할 수 있는가?
  • RQ2dp-GAN 훈련에서 공공 데이터를 제거할 경우, 강력한 비밀 보장 조건 하에서 지속적 학습 시스템의 성능에 어떤 영향을 미치는가?
  • RQ3지속적 학습에서 비밀 보장 예산(ε, δ)과 모델 정확도 사이의 상충 관계는 어떠한가?
  • RQ4비밀 보장이 아닌 기존의 지속적 학습 기반 모델(VCL 등)과 비교했을 때, DP-VGER는 잊음 정도와 정확도 측면에서 어떤가?

주요 결과

  • 1%의 공공 데이터를 사용한 DP-VGER는 코어셋 기반 기준보다 더 높은 정확도를 달성했으며, (1, 10⁻⁸)-dp 및 (2, 10⁻⁸)-dp 설정에서 비밀 보장이 없는 VGER와 유사한 성능을 보였다.
  • 공공 데이터를 완전히 제거한 경우, (5, 10⁻⁴)-dp 설정에서 비밀 보장이 없는 VGER에 비해 DP-VGER의 성능이 뚜렷이 열 劣하므로, 성능 유지를 위해 공공 데이터에 강하게 의존하고 있음을 시사한다.
  • 비밀 보장 GAN을 사용함으로써 모델은 원시 데이터를 저장하지 않고도 과거 작업의 지식을 유지할 수 있으며, (ε,δ)-비밀 보장 성질을 충족한다.
  • 사전 분포를 고정하고 생성 모델을 통해 가능성 항목만 업데이트함으로써, 개인정보 비용을 지속적 학습 과정에서 분리시키는 데 성공했다.
  • 엄격한 비밀 보장 조건(공공 데이터 없음)에서 성능 저하가 발생함을 고려할 때, 현재의 dp-GAN은 보조 데이터 없이 고비밀성·고유용성 지속적 학습에 충분히 견고하지 않다는 점을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.