[논문 리뷰] Understanding Adversarial Attacks on Observations in Deep Reinforcement Learning
이 논문은 딥 강화 학습에서 관측값에 대한 적대적 공격을 위한 기존의 최적화 기반 접근법의 한계를 해결하기 위해 기능 공간 재구성 기반의 새로운 접근법을 제안한다. 이는 먼저 환경과의 상호작용을 통해 속임수 정책을 훈련하고, 이후 관측값을 변형시켜 피해자를 오도하는 이중 단계 프레임워크를 도입한다. 이 방법은 이전의 최적화 기반 접근법보다 환경의 동역학을 더 효율적으로 활용하여 더 강력하고 효과적인 공격을 생성함으로써 아타리 및 머주코 환경에서 최신 기술 수준의 성능을 달성한다.
Deep reinforcement learning models are vulnerable to adversarial attacks that can decrease a victim's cumulative expected reward by manipulating the victim's observations. Despite the efficiency of previous optimization-based methods for generating adversarial noise in supervised learning, such methods might not be able to achieve the lowest cumulative reward since they do not explore the environmental dynamics in general. In this paper, we provide a framework to better understand the existing methods by reformulating the problem of adversarial attacks on reinforcement learning in the function space. Our reformulation generates an optimal adversary in the function space of the targeted attacks, repelling them via a generic two-stage framework. In the first stage, we train a deceptive policy by hacking the environment, and discover a set of trajectories routing to the lowest reward or the worst-case performance. Next, the adversary misleads the victim to imitate the deceptive policy by perturbing the observations. Compared to existing approaches, we theoretically show that our adversary is stronger under an appropriate noise level. Extensive experiments demonstrate our method's superiority in terms of efficiency and effectiveness, achieving the state-of-the-art performance in both Atari and MuJoCo environments.
연구 동기 및 목표
- 기존 최적화 기반 적대적 공격 방법이 환경의 동역학을 충분히 모델링하지 못해 최악의 성능을 달성하지 못하는 한계를 해결하기 위해.
- 마르코프 결정 과정(MDP)의 전체 동역학을 활용하면서 관측 공간을 대상으로 하는 더 효과적이고 효율적인 적대적 노이즈 생성 프레임워크를 개발하기 위해.
- 표적 공격이 비표적 공격보다 기능 공간에서 더 강력하다는 것을 이론적으로 및 실증적으로 입증하기 위해, 특히 적대자의 능력에 대해 낙관적인 가정을 할 경우에 대해.
- 먼저 악의적인 정책을 통해 최악의 궤적을 탐색하고, 이후 관측값을 변형시켜 피해자 정책을 오도하는 일반적인 이중 단계 프레임워크를 제공하기 위해.
- 적절한 노이즈 수준과 정책 분리 제약 조건 하에서 제안된 적대자가 이전 방법보다 더 강력하다는 이론적 기반을 구축하기 위해.
제안 방법
- 각 공격 유형이 별개의 기능 공간에 대응하도록 기능 공간에서 적대적 공격을 재구성함으로써, 더 나은 이론적 분석과 비교가 가능해진다.
- 이중 단계 공격 프레임워크를 도입한다: (1) 환경과의 상호작용을 통해 누적 보상이 최소가 되는 궤적을 찾는 악의적인 정책을 훈련하고, (2) 피해자 정책이 악의적인 정책을 모방하도록 오도하는 적대적 관측값을 생성한다.
- 기능 공간 재구성 기반으로 적대자를 원래 상태에서 적대적 상태로의 최적 매핑으로 모델링함으로써, 더 강력하고 표적화된 공격가능성을 확보한다.
- 기대 총 보상 차이를 바탕으로 한 성능 격차 상한선을 사용하며, 정책 간 TV 및 KL 발산을 활용해 공격 강도를 정량화한다.
- 기대 행동 이득, 정책 분리(비율 및 KL), 할인 요소를 포함한 이론적 상한선을 적용하여 공격의 효과성과 강건성을 보장한다.
- 공격자의 능력에 대해 낙관적인 가정(즉, 공격 대상 정책의 성능이 최악의 상황에 도달해야 한다는 가정)을 활용함으로써, 이전 연구에서의 비관적인 가정보다 공격 효율성을 향상시킨다.
실험 결과
연구 질문
- RQ1딥 강화 학습에서 관측값에 대한 적대적 공격를 기능 공간에서 체계적으로 재구성하여 공격 강도와 효과성을 향상시킬 수 있는가?
- RQ2기존 최적화 기반 방법들이 DRL에서 최소 누적 보상을 달성하지 못하는 이유는 무엇이며, 적대적 공격에서 환경의 동역학을 어떻게 더 효과적으로 활용할 수 있는가?
- RQ3어떤 이론적 조건이 제안된 적대자가 기대 수익을 최소화하는 데 있어 기존 공격 방법보다 더 강력하다는 것을 보장하는가?
- RQ4먼저 악의적인 정책을 학습하고, 이후 관측값을 변형시키는 이중 단계 프레임워크가 관측값에 직접 최적화하는 것보다 공격 성능을 어떻게 향상시키는가?
- RQ5기존 연구에서의 비관적 가정 대비, 적대자의 능력에 대해 낙관적인 가정이 공격 효과성에 얼마나 기여하는가?
주요 결과
- 제안된 방법은 아타리 및 머주코 환경 모두에서 최신 기술 수준의 성능을 달성하였으며, 공격 효과성과 효율성 측면에서 기존 최적화 기반 및 학습 기반 적대적 공격 방법을 모두 능가한다.
- 이론적 분석을 통해 제안된 적대자가 적절한 노이즈 수준 하에서 기존 방법보다 더 강력하다는 것을 입증하였으며, 성능 격차 상한선은 정책 분리와 행동 이득에 의존한다.
- 이중 단계 프레임워크는 악의적인 정책 훈련을 통해 최악의 궤적을 성공적으로 탐색하였으며, 이는 피해자를 비효율적인 행동으로 오도하는 더 효과적인 관측값 변형을 가능하게 하였다.
- 실증 결과는 기능 공간에서의 표적 공격이 비표적 공격보다 현저히 강력하다는 것을 보여주었으며, 표적 공격의 기능 공간은 더 크고 표현력이 뛰어나기 때문이다.
- 특히 아타리 게임과 같은 고차원 상태 공간(상태 차원 >6,000)에서는 기존 학습 기반 방법이 높은 계산 비용을 야기하는 데 비해, 본 방법은 더 뛰어난 효율성을 보였다.
- 이론적 상한선은 공격 성능가 적대자의 최적화 능력과 피해자 정책 및 악의적인 정책 간의 분리 정도와 밀접하게 연관되어 있음을 확인하였으며, 이는 본 방법의 강건성과 확장성에 대한 검증을 제공한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.