[논문 리뷰] Stealing Deep Reinforcement Learning Models for Fun and Profit
이 논문은 딥 강화학습(DRL) 모델에 대한 첫 번째 모델 추출 공격를 제시하며, 신뢰도 점수, 기울기 또는 사이드채널 데이터에 접근할 수 없음에도 불구하고 행동 쿼리만을 사용하여 블랙박스 DRL 정책을 높은 정밀도로 복원할 수 있도록 한다. 유사 학습과 행동 시간 시퀀스 기반으로 훈련된 새로운 알고리즘 분류기의 활용을 통해 공격는 정확한 모델 재구성과 워터마크 및 쿼리 빈도 탐지 방어를 우회할 수 있다.
This paper presents the first model extraction attack against Deep Reinforcement Learning (DRL), which enables an external adversary to precisely recover a black-box DRL model only from its interaction with the environment. Model extraction attacks against supervised Deep Learning models have been widely studied. However, those techniques cannot be applied to the reinforcement learning scenario due to DRL models' high complexity, stochasticity and limited observable information. We propose a novel methodology to overcome the above challenges. The key insight of our approach is that the process of DRL model extraction is equivalent to imitation learning, a well-established solution to learn sequential decision-making policies. Based on this observation, our methodology first builds a classifier to reveal the training algorithm family of the targeted black-box DRL model only based on its predicted actions, and then leverages state-of-the-art imitation learning techniques to replicate the model from the identified algorithm family. Experimental results indicate that our methodology can effectively recover the DRL models with high fidelity and accuracy. We also demonstrate two use cases to show that our model extraction attack can (1) significantly improve the success rate of adversarial attacks, and (2) steal DRL models stealthily even they are protected by DNN watermarks. These pose a severe threat to the intellectual property and privacy protection of DRL applications.
연구 동기 및 목표
- 특허받은 DRL 모델이 행동 쿼리만으로 블랙박스 접근을 통해 추출될 수 있는지 조사하기 위해.
- DRL 모델 추출에서 높은 복잡도, 확률적 성격 및 관측 가능성이 제한된 문제에 대응하기 위해.
- 신뢰도 점수, 기울기 또는 사이드채널 데이터에 접근할 수 없음에도 불구하고 고정밀도 모델 복원을 가능하게 하는 방법을 개발하기 위해.
- 공격의 실질적 영향을 입증하기 위해, 악성 공격를 강화하고 기존의 디지털 워터마킹 보호 기법을 우회하기 위해.
제안 방법
- 블랙박스 DRL 정책의 행동을 모방하는 것을 목표로 하여, DRL 모델 추출을 유사 학습 문제로 수식화하기 위해.
- 행동 시퀀스만을 사용하여 대상 DRL 모델의 훈련 알고리즘 패밀리를 예측하기 위한 순환 신경망(RNN) 기반 분류기 설계하기 위해.
- 예측된 알고리즘 패밀리를 사전 지식으로 활용하여 유사 학습을 안내함으로써, 추출된 모델의 정밀도와 수렴 속도 향상시키기 위해.
- 가상의 전문가 시퀀스로부터 서rogate 정책를 훈련하기 위해, 최신 유사 학습 기법(예: 생성적 적대적 유사 학습(GAIL))을 적용하기 위해.
- 모의 환경에서 대상 DRL 모델의 행동 시퀀스를 수집하여 알고리즘 분류기 훈련 및 유사 학습을 위한 전문가 경로 생성하기 위해.
- 알고리즘 분류기와 유사 학습 파이프라인을 통합하여 최소한의 쿼리 오버헤드로 종단 간 모델 추출을 가능하게 하기 위해.
실험 결과
연구 질문
- RQ1신뢰도 점수, 기울기 또는 사이드채널 정보에 접근할 수 없음에도 불구하고 행동 출력만을 사용하여 블랙박스 DRL 모델을 추출할 수 있는가?
- RQ2DRL 정책 내 임의성과 시간적 종속성을 어떻게 활용하여 기반 훈련 알고리즘 패밀리를 추론할 수 있는가?
- RQ3훈련 알고리즘 패밀리에 대한 사전 지식이 모델 추출의 정밀도와 정확도에 어느 정도 기여하는가?
- RQ4추출된 모델를 사용하여 악성 공격의 성공률를 높이거나, 기존의 지적 재산 보호 기법(예: 디지털 워터마킹)을 우회할 수 있는가?
주요 결과
- 제안된 방법은 복잡한 딥 아키텍처를 사용하는 대상 모델일지라도 고정밀도 및 고정확도로 DRL 모델을 성공적으로 복원한다.
- 행동 시퀀스만을 사용하여도 알고리즘 분류기가 높은 정확도로 훈련 알고리즘 패밀리를 예측할 수 있어, 효과적인 사전 지식 기반 유사 학습이 가능하다.
- 추출된 모델는 악성 공격의 성공률를 크게 향상시켜, 모델 추출 공격의 실질적 위협성을 입증한다.
- 워터마킹 메커니즘을 성공적으로 우회하였으며, 추출된 모델는 원본 워터마킹을 유지하지 않는다.
- 일반적인 쿼리 패tern에서 공격가 효과를 유지하여, 쿼리 빈도 분석 기반 탐지 메커니즘을 회피한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.