Skip to main content
QUICK REVIEW

[논문 리뷰] Adversarial Attacks on Neural Network Policies

Sandy H. Huang, Nicolas Papernot|arXiv (Cornell University)|2017. 02. 08.
Adversarial Robustness in Machine Learning인용 수 68
한 줄 요약

이 논문은 심층 강화 학습에서 신경망 정책이 흑박과 백박 설정 모두에서 다양한 알고리즘과 Atari 태스크에 걸쳐 적대적 예제에 취약하다는 것을 보여준다.

ABSTRACT

Machine learning classifiers are known to be vulnerable to inputs maliciously constructed by adversaries to force misclassification. Such adversarial examples have been extensively studied in the context of computer vision applications. In this work, we show adversarial attacks are also effective when targeting neural network policies in reinforcement learning. Specifically, we show existing adversarial example crafting techniques can be used to significantly degrade test-time performance of trained policies. Our threat model considers adversaries capable of introducing small perturbations to the raw input of the policy. We characterize the degree of vulnerability across tasks and training algorithms, for a subclass of adversarial-example attacks in white-box and black-box settings. Regardless of the learned task or training algorithm, we observe a significant drop in performance, even with small adversarial perturbations that do not interfere with human perception. Videos are available at http://rll.berkeley.edu/adversarial.

연구 동기 및 목표

  • 심층 RL으로 학습된 신경망 정책에 대한 adversarial 예제가 서로 다른 학습 알고리즘에서 어떻게 영향을 미치는지 특성화한다.
  • DQN, TRPO, A3C로 학습된 정책에 대해 흑박 및 백박 공격 시나리오를 조사한다.
  • 정책 간 및 학습 알고리즘 간의 adversarial 예제의 전달 가능성(전이 가능성)을 평가한다.

제안 방법

  • l_infty, l_2, l_1 노름 하에서 적대적 섭동을 생성하기 위해 Fast Gradient Sign Method(FGSM)을 적용한다.
  • 정책 출력을 확률 분포로 간주하고 가장 큰 가중치를 가진 행동과 일치하는 교차 엔트로피 손실을 사용하여 섭동을 계산한다.
  • 세 가지 알고리즘(DQN, TRPO, A3C)으로 학습된 네 가지 Atari 게임(Chopper Command, Pong, Seaquest, Space Invaders)을 대상으로 공격을 평가한다.
  • 대상 정책에 대한 전체 접근 권한이 있는 흑박 공격과 정책 간 및 알고리즘 간 전이를 통해 비교하는 백박 공격을 비교한다.

실험 결과

연구 질문

  • RQ1다양한 심층 RL 알고리즘에서 테스트 시 성능 저하를 유발하는 adversarial 예제의 효과는 얼마나 큰가?
  • RQ2같은 작업에 대해 서로 다른 아키텍처나 학습 방법으로 학습된 정책 간에 adversarial 섭동이 전달되는가?
  • RQ3딥 RL 정책에서 흑박 위협 모델과 백박 위협 모델 간의 공격 효과는 어떻게 다른가?
  • RQ4다른 노름 제약(l_infty, l_2, l_1)을 사용할 때 RL 정책에 대한 공격의 강도에 어떤 영향이 있는가?

주요 결과

  • DQN, TRPO, A3C에 걸친 신경망 정책은 적대적 입력에 취약하여 상당한 성능 저하를 보인다.
  • TRPO 및 A3C 정책은 적대적 섭동 하에서 DQN에 비해 상대적으로 강인성을 보인다.
  • l_infty FGSM은 작은 에psilon에서 일부 작업의 성능을 50% 이상 감소시킬 수 있으며, l_1 섭동은 몇 픽셀의 변화를 통해 큰 성능 저하를 유발할 수 있다.
  • 한 정책에 대해 학습된 적대적 섭동은 같은 작업을 해결하는 다른 정책으로 전달될 수 있어 전이 가능성을 보인다.
  • 전이 가능성은 같은 알고리즘의 정책 간에 더 강하고 다른 알고리즘 간에는 약하지만, 더 큰 섭동 크기에서 여전히 영향력이 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.