Skip to main content
QUICK REVIEW

[논문 리뷰] Enhanced Adversarial Strategically-Timed Attacks against Deep Reinforcement Learning

Chao-Han Huck Yang, Jun Qi|arXiv (Cornell University)|2020. 02. 20.
Adversarial Robustness in Machine Learning참고 문헌 24인용 수 25
한 줄 요약

이 논문은 3D 환경에서 물리적 노이즈를 전략적으로 선택된 시간 프레임에 주입함으로써 딥 강화학습(DRL) 내비게이션 시스템에 대한 향상된 적대적 전략적 타이밍 공격을 제안한다. 가용 모델 정보가 있는 환경에서 동적 타이밍 결정을 위한 가중 평균 온라인 학습을 사용하는 화이트박스 공격과, 정책 기반 유사 모방을 통한 블랙박스 공격을 제안하며, 이는 세 가지 3D 환경(로봇 암 제어, 바나나 수확, 자율주행 자동차)에서 제로 아웃, 가우시안, FGSM 적대적 노이즈 패턴 모두에서 DRL 성능을 크게 떨어뜨린다.

ABSTRACT

Recent deep neural networks based techniques, especially those equipped with the ability of self-adaptation in the system level such as deep reinforcement learning (DRL), are shown to possess many advantages of optimizing robot learning systems (e.g., autonomous navigation and continuous robot arm control.) However, the learning-based systems and the associated models may be threatened by the risks of intentionally adaptive (e.g., noisy sensor confusion) and adversarial perturbations from real-world scenarios. In this paper, we introduce timing-based adversarial strategies against a DRL-based navigation system by jamming in physical noise patterns on the selected time frames. To study the vulnerability of learning-based navigation systems, we propose two adversarial agent models: one refers to online learning; another one is based on evolutionary learning. Besides, three open-source robot learning and navigation control environments are employed to study the vulnerability under adversarial timing attacks. Our experimental results show that the adversarial timing attacks can lead to a significant performance drop, and also suggest the necessity of enhancing the robustness of robot learning systems.

연구 동기 및 목표

  • DRL 기반 내비게이션 시스템이 시간 기반 적대적 공격에 취약한지 조사한다.
  • 최적의 공격 타이밍을 확보하기 위해 가중 평균 온라인 학습을 활용한 화이트박스 공격 전략을 개발한다.
  • 모델 접근 권한 없이도 공격자가 타겟의 정책을 모방할 수 있는 블랙박스 공격 방법을 설계한다.
  • 실제 3D 환경에서 다양한 노이즈 패턴(제로 아웃, 가우시안, FGSM) 하에서 DRL 에이전트의 강인성(로버스트니)을 평가한다.
  • 가치 기반(DQN)과 정책 기반(A3C) DRL 모델이 이러한 공격에 매우 취약함을 입증한다.

제안 방법

  • 노이즈 관측 프레임워크 제안: noisy_st = st + noise(t), 여기서 noise(t)는 선택된 시간 단계에 주입된다.
  • 세 가지 노이즈 유형 정의: T1(펄스형 제로 아웃), T2(가우시안 센서 융합 노이즈), T3(ℓ∞-노름 제약 조건이 있는 FGSM 생성 적대적 패턴).
  • 행동 비용 차이를 기반으로 잠재 에너지를 추정하고 공격 타이밍을 선택하기 위해 가중 평균 알고리즘(WMA)을 사용하는 화이트박스 공격 개발.
  • 공격자가 역 강화 학습을 통해 타겟의 행동을 모방하는 정책 에이전트를 훈련시키는 PEPG-ASA 기반 블랙박스 공격 도입.
  • 공격 정책 최적화를 위해 로그 확률 샘플링을 통한 기울기 추정 사용: ∇ρE(ρ) ≈ 1/N Σ ∇ρ log p(θ|ρ)r(hn).
  • 세 개의 오픈소스 유니티-3D 환경 사용: Env1(연속형 로봇 암), Env2(바나나 수확), Env3(도나키카르 자율주행 시뮬레이션).

실험 결과

연구 질문

  • RQ1전략적으로 타이밍을 조절한 적대적 공격가 DRL 기반 내비게이션 시스템의 성능을 상당히 떨어뜨릴 수 있는가?
  • RQ2가중 평균 온라인 학습을 활용한 화이트박스 공격가 기존의 랜덤 또는 이전 방법에 비해 타이밍 선택에서 얼마나 효과적인가?
  • RQ3모델 파rameter에 접근할 수 없는 블랙박스 공격자가 행동과 보상에서 학습함으로써 DRL 에이전트를 성공적으로 악용할 수 있는가?
  • RQ4다양한 노이즈 패턴(제로 아웃, 가우시안, FGSM)이 연속 제어 및 내비게이션 작업에서 DRL 에이전트의 강인성에 어떤 영향을 미치는가?
  • RQ5실제 3D 환경에서 DQN과 A3C 에이전트가 이러한 시간 기반 공격에 얼마나 심각하게 실패하는가?

주요 결과

  • WMA 화이트박스 공격는 Env1(DQN)에서 평균 수익을 최대 86% 감소시키고, Env2(A3C)에서는 89% 감소시켰으며, 보상은 약 30에서 약 3으로 감소했다.
  • 블랙박스 PEPG-ASA 공격는 유사한 정도의 성능 저하를 이룩했으며, Env2(DQN)에서는 보상을 약 12에서 약 5로, Env3(A3C)에서는 약 1.1에서 약 0.6으로 감소시켰다.
  • 동일한 노이즈 패턴(FGSM) 조건에서도 시간 기반 공격는 무작위 간섭보다 훨씬 효과적이었으며, 후자는 보상 약 20% 감소에 그쳤다.
  • Lin et al. [16] 기준선 방법은 PEPG-ASA와 유사한 성능를 보였지만, WMA는 화이트박스 및 블랙박스 환경 모두에서 그에 비해 뛰어난 성능를 보였다.
  • 모든 공격는 DQN과 A3C 에이전트 모두에서 일관된 성능 저하를 유도했으며, 가치 기반 및 정책 기반 DRL의 광범위한 취약성을 보여주었다.
  • 결과는 DRL 에이전트가 노이즈가 몇 프레임에만 국한되더라도 적대적 타이밍에 매우 민감함을 입증하며, 강인한 방어 메커니즘의 필요성을 강조한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.