Skip to main content
QUICK REVIEW

[논문 리뷰] NN-EMD: Efficiently Training Neural Networks using Encrypted Multi-Sourced Datasets

Runhua Xu, James Joshi|arXiv (Cornell University)|2020. 12. 18.
Privacy-Preserving Technologies in Data참고 문헌 59인용 수 10
한 줄 요약

이 논문은 하이브리드 기능 암호화를 사용하여 암호화된 다중 소스 데이터셋에서 딥 네ural 네트워크(DNNs)를 효율적으로 훈련하기 위한 새로운 프레임워크인 NN-EMD를 제안한다. 이는 신뢰할 수 없는 다수의 데이터 소스 간에 안전하고 프라이버시를 보장하는 훈련을 가능하게 하며, 기존 방법 대비 훈련 시간을 97% 감소시킨다. 모델 깊이가 증가함에 따라 성능 저하 없이도 기능을 유지한다.

ABSTRACT

Training a machine learning model over an encrypted dataset is an existing promising approach to address the privacy-preserving machine learning task, however, it is extremely challenging to efficiently train a deep neural network (DNN) model over encrypted data for two reasons: first, it requires large-scale computation over huge datasets; second, the existing solutions for computation over encrypted data, such as homomorphic encryption, is inefficient. Further, for an enhanced performance of a DNN model, we also need to use huge training datasets composed of data from multiple data sources that may not have pre-established trust relationships among each other. We propose a novel framework, NN-EMD, to train DNN over multiple encrypted datasets collected from multiple sources. Toward this, we propose a set of secure computation protocols using hybrid functional encryption schemes. We evaluate our framework for performance with regards to the training time and model accuracy on the MNIST datasets. Compared to other existing frameworks, our proposed NN-EMD framework can significantly reduce the training time, while providing comparable model accuracy and privacy guarantees as well as supporting multiple data sources. Furthermore, the depth and complexity of neural networks do not affect the training time despite introducing a privacy-preserving NN-EMD setting.

연구 동기 및 목표

  • 데이터 기밀성을 훼손하지 않으면서 기밀성에 민감한 다중 소스 데이터셋에서 딥 네ural 네트워크를 훈련시키는 도전 과제를 해결한다.
  • 대규모 DNN 훈련에서 히브리드 암호화나 일반적인 안전한 다자간 계산의 비효율성을 극복한다.
  • 기존 신뢰 관계가 없는 다수의 데이터 소스 간에 안전한 훈련을 가능하게 한다.
  • 수평적 및 수직적 데이터 분할을 모두 지원하면서도 프라이버시를 유지한다.
  • 비프라이버시 훈련 기준과 비교해도 높은 훈련 효율성과 모델 정확도를 달성한다.

제안 방법

  • DNN의 내적 곱 및 행렬 곱 연산에 특화된 하이브리드 기능 암호화 체계를 기반으로 한 안전한 계산 프레임워크를 설계한다.
  • 기능 암호화를 활용해 데이터를 해독하지 않고도 암호화된 상태에서 계산을 수행함으로써 클라우드 제공자가 데이터를 볼 수 없도록 보장한다.
  • DNN 훈련을 선형 대수 기초 연산에 대한 안전한 프로토콜로 분해하며, 전방 및 역방향 전파와 같은 핵심 연산을 기능 암호화로 처리한다.
  • 다수의 신뢰할 수 없는 데이터 소스에서 수평적 및 수직적 데이터 분할을 지원하는 프로토콜을 통합한다.
  • 특히 대규모 데이터셋에 적합하도록 커뮤니케이션 및 계산 오버헤드를 최소화하기 위해 프로토콜 스택을 최적화한다.
  • 완전한 히브리드 암호화의 성능 저하 문제를 피하기 위해 특정 연산에 대해 기능 암호화의 효율성을 활용한다.

실험 결과

연구 질문

  • RQ1수평적 및 수직적 데이터 분할을 모두 지원하면서도 신뢰할 수 없는 다수의 데이터 소스에서 기능을 보장하는 프라이버시 보장 DNN 훈련 프레임워크를 구축할 수 있는가?
  • RQ2기능 암호화를 사용해 암호화된 상태에서 행렬 곱셈 및 내적 연산과 같은 핵심 DNN 연산을 어떻게 효율적으로 적용할 수 있는가?
  • RQ3기존의 히브리드 암호화나 SMC 기반 접근 방식에 비해 암호화된 DNN 훈련에서 훈련 시간을 얼마나 줄일 수 있는가?
  • RQ4모델 깊이 또는 복잡도가 프라이버시 보장 환경에서 훈련 성능에 크게 영향을 미치는가?
  • RQ5강력한 프라이버시 보장을 제공하면서도 비암호화 훈련과 비교해 모델 정확도를 유지할 수 있는가?

주요 결과

  • NN-EMD는 기존의 프라이버시 보장 틀워크 대비 훈련 시간을 97% 감소시켜 효율성을 크게 향상시켰다.
  • 프레임워크는 MNIST 데이터셋에서 비암호화 훈련과 동일한 모델 정확도를 유지하여 강력한 실용성을 입증했다.
  • 기존 방법과 달리 모델 깊이 또는 복잡도가 증가하더라도 훈련 시간이 안정적이고 효율적으로 유지된다.
  • 시스템은 다수의 신뢰할 수 없는 데이터 소스에서 수평적 및 수직적 데이터 분할을 모두 지원하여 더 넓은 배포 가능성을 확보했다.
  • 하이브리드 기능 암호화의 사용으로 클라우드 제공자가 데이터를 해독하지 않고도 안전한 계산을 수행할 수 있었다.
  • 프레임워크는 제3자 클라우드 인프라로부터 훈련 및 추론 데이터를 강력하게 보호하는 강력한 프라이버시 보장을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.