Skip to main content
QUICK REVIEW

[논문 리뷰] Differentially private training of residual networks with scale normalisation

Helena Klause, Alexander Ziller|arXiv (Cornell University)|2022. 03. 01.
Privacy-Preserving Technologies in Data인용 수 13
한 줄 요약

이 논문은 잔차 연결의 덧셈 연산 뒤에 정규화 레이어를 추가하는 간단한 아키텍처 수정인 ScaleNorm을 소개한다. 이는 잔차 경로와 컨볼루션 경로의 활성화가 스케일이 맞지 않는 '스케일 믹싱' 현상, 즉 스케일이 맞지 않는 현상을 완화한다. DP-SGD와 최근의 트레이닝 적응 기법을 함께 적용함으로써, CIFAR-10에서 ε=8.0일 때 82.5%의 새로운 최고 성능(top-1 정확도)을 달성하였다. 이는 초기 가중치에서부터 학습한 결과이다.

ABSTRACT

The training of neural networks with Differentially Private Stochastic Gradient Descent offers formal Differential Privacy guarantees but introduces accuracy trade-offs. In this work, we propose to alleviate these trade-offs in residual networks with Group Normalisation through a simple architectural modification termed ScaleNorm by which an additional normalisation layer is introduced after the residual block's addition operation. Our method allows us to further improve on the recently reported state-of-the art on CIFAR-10, achieving a top-1 accuracy of 82.5% (ε=8.0) when trained from scratch.

연구 동기 및 목표

  • 의료 및 시각 응용 분야에서 높은 정확도와 강력한 프라이버시를 요구하는 딥 네트워크의 차별적 프라이버시 학습에서의 프라이버시-유용성 트레이드오프 문제를 다루는 것.
  • DP-SGD 학습 중에 발생하는 잔차 네트워크의 '스케일 믹싱' 문제를 규명하고 해결하는 것. 이는 잔차 경로 활성화는 정규화되지 않은 반면, 특징 경로 활성화는 정규화되어 있는 현상이다.
  • 최소한의 아키텍처 변경을 통해 DP-SGD로 학습한 ResNet의 수렴성과 테스트 정확도를 향상시키는 것.
  • 기존의 트레이닝 적응 기법과 결합한 ScaleNorm이 차별적 프라이버시 하에서 이미지 벤치마크에서 최고 성능을 달성할 수 있음을 보여주는 것.

제안 방법

  • ScaleNorm을 제안한다: 잔차 블록의 잔차 연결 덧셈 연산 뒤에 삽입되는 추가 정규화 레이어이다.
  • 차별적 프라이버시 보장을 유지하기 위해 잔차 경로에 그룹 정규화를 적용하여 배치 정규화를 대체한다. 배치 정규화는 DP-SGD와 호환되지 않는다.
  • 표준 ResNet과 WideResNet 아키텍처에 ScaleNorm을 통합하여, 전방 전파 과정을 수정하여 잔차 경로와 특징 경로의 합을 정규화하도록 한다.
  • 차별적 프라이버시 확보를 위한 확률적 경사 하강법(DP-SGD)을 사용하여 모델을 학습하고, Rényi DP 회계 기법(Opacus)을 통해 프라이버시 회계를 수행한다.
  • De 등(2022)에서 제안한 최근의 트레이닝 적응 기법, 예를 들어 증강 다중성과 가중치 평균화를 적용하여 성능을 추가로 향상시킨다.
  • Optuna를 사용하여 초모델 하이퍼파rameter 검색을 수행하며, 트리 기반 파르젠 추정기와 임계값 자르기 기법을 사용하고, 각 실행 시 프라이버시 예산을 재설정한다.

실험 결과

연구 질문

  • RQ1잔차 네트워크에서의 스케일 믹싱 현상이 DP-SGD 하에서 학습 수렴성과 테스트 정확도에 어떤 영향을 미치는가?
  • RQ2ScaleNorm과 같은 단순한 아키텍처 수정이 스케일 믹싱 문제를 효과적으로 완화하고, 차별적 프라이버시 학습에서 모델 성능을 향상시킬 수 있는가?
  • RQ3고도의 트레이닝 기법과 결합했을 때 ScaleNorm이 DP-SGD에서 정확도 향상에 얼마나 기여하는가?
  • RQ4ScaleNorm은 CIFAR-10, ImageNette, Tiny ImageNet 등 다양한 아키텍처와 데이터셋에 일반화되는가?
  • RQ5고성능 트레이닝 기법을 적용할 경우, ScaleNorm 적용에 따른 정확도 향상과 훈련 효율성 간의 트레이드오프는 어떠한가?

주요 결과

  • CIFAR-10에서 ε=8.0일 때, ScaleNorm을 사용해 초기 가중치에서부터 학습한 결과, 82.5%의 top-1 정확도를 달성하여 새로운 최고 성능을 수립하였다.
  • CIFAR-10에서 동일한 프라이버시 예산 하에 표준 WRN-16/4(81.25% 대비 82.5%)보다 1.25%포인트 높은 정확도를 기록하였다.
  • ImageNette에서 ε=9.88일 때, ScaleNorm은 top-1 정확도를 1.3%포인트 향상시켰다(67.1% 대비 65.0%).
  • Tiny ImageNet에서 ε=70일 때, ScaleNorm은 25.8%의 top-1 정확도를 기록하여 베이스라인보다 1.1%포인트 높은 성능을 보였다.
  • 시험한 모든 프라이버시 수준에서 개선 효과가 일관되게 관찰되었으며, 높은 프라이버시 예산에서 가장 큰 상대적 향상이 관찰되었다.
  • ScaleNorm과 완전한 트레이닝 적응 기법을 함께 적용할 경우, 훈련 시간은 약 16시간(dual GPU 기준)으로 증가하지만, 베이스라인 모델 대비 10%의 정확도 향상을 달성하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.