Skip to main content
QUICK REVIEW

[논문 리뷰] Snooping Attacks on Deep Reinforcement Learning

Matthew Inkawhich, Yiran Chen|arXiv (Cornell University)|2019. 05. 28.
Adversarial Robustness in Machine Learning참고 문헌 36인용 수 10
한 줄 요약

이 논문은 딥 강화 학습(DRL) 에이전트를 대상으로 한 스노핑 공격 위협 모델을 제안한다. 여기서 악성 공격자는 환경에 대한 접근 없이 행동 및 보상 신호만 도청한다. 관련 작업에 대해 프록시 모델을 훈련시켜 전이 가능한 교란을 통해 효과적인 악성 공격를 수행함으로써, 모델 또는 환경에 대한 액세스 없이도 Atari 환경에서 DRL 에이전트 성능이 심각하게 떨어질 수 있음을 보여준다.

ABSTRACT

Adversarial attacks have exposed a significant security vulnerability in state-of-the-art machine learning models. Among these models include deep reinforcement learning agents. The existing methods for attacking reinforcement learning agents assume the adversary either has access to the target agent's learned parameters or the environment that the agent interacts with. In this work, we propose a new class of threat models, called snooping threat models, that are unique to reinforcement learning. In these snooping threat models, the adversary does not have the ability to interact with the target agent's environment, and can only eavesdrop on the action and reward signals being exchanged between agent and environment. We show that adversaries operating in these highly constrained threat models can still launch devastating attacks against the target agent by training proxy models on related tasks and leveraging the transferability of adversarial examples.

연구 동기 및 목표

  • 딥 강화 학습(DRL) 에이전트에 대해 악성 공격 위협 모델의 새로운 클래스인 스노핑 공격를 식별하고 체계화하는 것.
  • 환경 또는 모델 파라미터에 접근할 수 없는 매우 제한된 도청 조건 하에서도 DRL 에이전트에 효과적인 블랙박스 공격가 가능한지 조사하는 것.
  • 다른 목적 함수를 사용하지만 관련된 작업을 수행하는 DRL 에이전트 간에 악성 예제의 전이 가능성 평가하는 것.
  • 환경 상호작용 없이도 시간이 제한된, 침투성이 높은 공격를 가능하게 하는 프록시 기반 공격 프레임워크 개발 및 검증하는 것.

제안 방법

  • 저자들은 공격자가 환경 상태나 파라미터를 관찰하지 못하고 행동 및/또는 보상 신호만 관찰하는 스노핑 위협 모델을 정의한다.
  • 목표 에이전트의 행동을 모방하기 위해 관련 작업에 대해 프록시 모델을 훈련시고, 이를 통해 악성 예제를 생성한다.
  • 프록시 모델에서 빠른 기울기 방법(Fast Gradient Method, FGM)을 사용하여 전이성을 활용해 타겟 DRL 에이전트에 악성 예제를 제작한다.
  • 공격 전략은 환경 상호작용 없이도 효과적인 공격를 가능하게 하는 이mites터 기울기로 교란을 유도한다.
  • 특정 시간 단계(예: Pong에서 공이 패드에 가까워지는 순간)에 집중하는 전략적 타이밍 공격 변형을 포함하여 공격 효율성을 높인다.
  • 보상 신호의 분산을 추정하기 위해 평가자 네트워크를 사용하여 기울기 기반 공격 생성 시 노이즈를 줄인다.

실험 결과

연구 질문

  • RQ1공격자가 환경 또는 모델 파라미터에 접근할 수 없고 행동 및 보상 신호만 도청할 경우, DRL 에이전트에 효과적인 블랙박스 악성 공격가 가능한가?
  • RQ2다른 최적화 목표를 가진 DRL 에이전트 간에 악성 예제의 전이 가능성은 어느 정도인가?
  • RQ3공격자가 환경 상호작용을 할 수 없는 조건에서, 전이 기반 공격의 성능은 서rogate 기반 공격에 비해 어떻게 비교되는가?
  • RQ4시간이 제한된, 전략적으로 타이밍을 맞춘 공격가 스노핑 제약 조건 하에서 침투성과 효과성을 향상시킬 수 있는가?
  • RQ5기본적으로 다른 목표를 가진 모델 간의 전이성을 가능하게 하는 입력 공간에서의 기울기 유사성의 역할은 무엇인가?

주요 결과

  • 관련 작업에 대해 훈련된 프록시 모델을 사용한 악성 공격는 스노핑 제약 조건이 엄격한 상황에서도 Atari 환경에서 DRL 에이전트의 성능을 심각하게 떨어뜨린다.
  • 제안된 ACP+Assessor 방법은 무작위 교란 전략보다 우수하며, 환경 상호작용 없이 DQN 및 PPO 에이전트 모두에서 상당한 성능 저하를 이끌어낸다.
  • 프록시 모델에서 제작된 악성 예제는 프록시와 타겟 에이전트의 목적이 다를 경우에도 효과적으로 전이되며, 이는 기울기 형태 유사성이 전이성을 가능하게 한다는 것을 시사한다.
  • 보상 신호의 분산이 높아도 공격는 효과적이며, 이는 노이즈가 많거나 희박한 피드백 조건에서도 방법이 강건함을 시사한다.
  • 이터레이티브 방법이 프록시 모델의 국소 최적점에 과적합되는 것과 관련하여, 이머리터 기울기를 사용한 FGM 방법은 MIFGM보다 전이 기반 공격에서 성능이 뛰어나다.
  • 시각화 결과, 다양한 프록시 모델에서 유도된 기울기의 선명도 패턴이 시각적으로 유사함을 확인하여, 기울기 기하학이 모델 간 전이성을 가능하게 한다는 가설을 뒷받침한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.