Skip to main content
QUICK REVIEW

[논문 리뷰] Model Extraction Attacks against Recurrent Neural Networks

Tatsuya Takemura, Naoto Yanai|arXiv (Cornell University)|2020. 02. 01.
Adversarial Robustness in Machine Learning참고 문헌 22인용 수 4
한 줄 요약

이 논문은 중간 출력과 고유 손실 함수를 활용하여 순환 신경망(RNNs)과 장단기 기억(LSTM) 네트워크에 대한 새로운 모델 추출 공격 기법을 제시한다. 연구에서는 악성 사용자가 원본 LSTM보다 더 높은 정확도를 가진 대체 모델을 단지 20%의 훈련 데이터와 부분적 쿼리 접근 권한을 통해 추출할 수 있음을 입증하며, 특히 소프트맥스 온도 조정과 시퀀스 수준의 출력 누출을 통해 이를 실현한다.

ABSTRACT

Model extraction attacks are a kind of attacks in which an adversary obtains a new model, whose performance is equivalent to that of a target model, via query access to the target model efficiently, i.e., fewer datasets and computational resources than those of the target model. Existing works have dealt with only simple deep neural networks (DNNs), e.g., only three layers, as targets of model extraction attacks, and hence are not aware of the effectiveness of recurrent neural networks (RNNs) in dealing with time-series data. In this work, we shed light on the threats of model extraction attacks against RNNs. We discuss whether a model with a higher accuracy can be extracted with a simple RNN from a long short-term memory (LSTM), which is a more complicated and powerful RNN. Specifically, we tackle the following problems. First, in a case of a classification problem, such as image recognition, extraction of an RNN model without final outputs from an LSTM model is presented by utilizing outputs halfway through the sequence. Next, in a case of a regression problem. such as in weather forecasting, a new attack by newly configuring a loss function is presented. We conduct experiments on our model extraction attacks against an RNN and an LSTM trained with publicly available academic datasets. We then show that a model with a higher accuracy can be extracted efficiently, especially through configuring a loss function and a more complex architecture different from the target model.

연구 동기 및 목표

  • 기존 문헌에서 다루지 않은 바가 많은 순환 신경망(RNNs)과 장단기 기억(LSTM) 네트워크에 대한 모델 추출 공격의 가능성과 효과성을 탐구하는 것.
  • 순차적 처리와 은닉 상태 피드백 등의 아키텍처적 특징을 악용하는 새로운 공격 전략을 개발하는 것.
  • 원본 모델보다 더 높은 정확도를 가진 대체 모델을 더 적은 자원으로 추출할 수 있음을 입증하는 것.
  • 모델 아키텍처의 복잡성과 손실 함수 설계가 모델 추출 공격 성공에 미치는 영향을 평가하는 것.
  • 기존 방어 기법인 워터마킹과 차별적 프라이버시의 실용적 대응 조치와 한계를 탐색하는 것.

제안 방법

  • 분류 작업의 경우, 시퀀스 처리 중 LSTM 모델의 중간 출력(최종 출력 외)을 활용하여 대체 RNN을 훈련시킨다.
  • 정보 유출을 향상시키기 위해 소프트맥스에 온도 조정을 적용하여 모델 로짓에 포함된 정보를 증가시킨다.
  • 회귀 작업의 경우, 교사 기반 회귀 기반의 새로운 손실 함수를 도입하여 대체 모델의 예측을 원본 모델의 출력과 일치시킨다.
  • 대체 모델은 원본 모델의 쿼리 응답을 사용하여 훈련되며, 원본 데이터셋의 레이블과 예측 결과를 지도로 활용한다.
  • 정확도와 자원 제약 조건 하에서의 일반화 성능을 측정하기 위해 MNIST(시계열로 변환됨) 및 공기질 데이터셋에서 공격를 평가한다.
  • 성능 향상을 위해 대체 모델의 아키텍처를 원본보다 의도적으로 더 복잡하게 설계하여 아키텍처의 유연성을 활용한다.

실험 결과

연구 질문

  • RQ1부분적 쿼리 접근 권한만으로 원본 LSTM 모델보다 더 높은 정확도를 가진 대체 RNN 모델을 추출할 수 있는가?
  • RQ2중간 출력(중간 시퀀스)을 활용할 경우 RNN 기반 공격에서 추출된 모델의 품질이 어떻게 향상되는가?
  • RQ3고유 손실 함수가 회귀 작업에서 대체 모델의 성능을 어느 정도 향상시킬 수 있는가?
  • RQ4모델 추출 공격 성공에 있어 아키텍처의 복잡성이 어떤 역할을 하는가?
  • RQ5워터마킹과 차별적 프라이버시와 같은 기존 방어 기법이 이러한 고도화된 모델 추출 기법에 얼마나 효과적인가?

주요 결과

  • MNIST에서 대체 RNN 모델은 원본 훈련 데이터의 20%만을 사용해 97.5%의 정확도를 달성했으며, 원본 LSTM의 97.3%보다 略로 높은 성능을 보였다.
  • 공기질 데이터셋에서의 회귀 작업에서, 대체 모델은 3개월 분량의 훈련 데이터만으로 R² 87.2%를 달성했고, 원본 모델의 10개월 데이터 기반 89.9%보다 다소 낮은 성능이었지만, 자원 소모를 크게 줄였다.
  • 온도 조정을 적용한 소프트맥스 사용이 원본 모델의 정보 누출을 크게 향상시켜 더 정밀한 대체 모델 추출을 가능케 하였다.
  • 공격는 RNN의 순차적 특성을 악용하여, 최종 출력 외에 존재하는 중간 은닉 상태에 포함된 예측 가능 신호를 활용함으로써 성공하였다.
  • 더 복잡한 대체 아키텍처가 단순한 아키텍처보다 뛰어난 성능을 보였으며, 이는 아키텍처의 자유도가 모델 추출 성공에 기여함을 시사한다.
  • 워터마킹과 차별적 프라이버시와 같은 기존 방어 기법은 충분하지 않으며, 이는 추출을 방지하지 못하고 디스틸레이션 기반 공격로 쉽게 우회될 수 있음을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.