Skip to main content
QUICK REVIEW

[논문 리뷰] CopyCAT: Taking Control of Neural Policies with Constant Attacks

Léonard Hussenot, Matthieu Geist|arXiv (Cornell University)|2019. 05. 29.
Adversarial Robustness in Machine Learning참고 문헌 33인용 수 16
한 줄 요약

CopyCAT는 딥 강화학습 에이전트의 내부 상태를 수정하지 않고 관측값에 사전에 계산된 일정한 마스크를 적용함으로써 타겟된 실시간 적대적 공격이다. 이는 에이전트의 행동을 완전히 제어할 수 있게 하며, Atari 2600 게임에서 타겟 정책을 모방하도록 유도한다. 흰 상자 및 초도 검은 상자 설정에서도 성공적으로 작동하며, ImageNet에서도 일반화된 적대적 예제를 보여준다.

ABSTRACT

We propose a new perspective on adversarial attacks against deep reinforcement learning agents. Our main contribution is CopyCAT, a targeted attack able to consistently lure an agent into following an outsider's policy. It is pre-computed, therefore fast inferred, and could thus be usable in a real-time scenario. We show its effectiveness on Atari 2600 games in the novel read-only setting. In this setting, the adversary cannot directly modify the agent's state -- its representation of the environment -- but can only attack the agent's observation -- its perception of the environment. Directly modifying the agent's state would require a write-access to the agent's inner workings and we argue that this assumption is too strong in realistic settings.

연구 동기 및 목표

  • 딥 강화학습 에이전트의 내부 상태를 수정하지 않고 실시간으로 타겟된 공격을 개발하는 것.
  • 이전 공격들이 에이전트 상태에 쓰기 액세스가 필요로 하는 한계를 해결하는 것. 이는 실제 상황에서는 비현실적이다.
  • 관측 수준의 교란을 통해 임의의 타겟 정책과 정책을 일치시킴으로써 에이전트의 행동을 완전히 제어하는 것.
  • 백색 상자 및 검은 상자 설정 모두에서 방법을 검증하는 것. 특히 ImageNet과 같은 현실적인 이미지 환경에서도 적용한다.
  • 고차원적이고 현실적인 관측 공간에서 일반화된 적대적 예제의 가능성 입증

제안 방법

  • CopyCAT은 상태에 종속되지 않은 유한한 수의 덧셈 마스크를 사전에 계산하여 에이전트의 관측값에 직접 적용한다. 내부 상태에는 영향을 주지 않는다.
  • 공격는 타겟 정책과 에이전트의 행동 간의 이질성을 최소화하는 타겟된 최적화 문제로 설정된다.
  • 마스크는 다양한 관측 분포에서 에이전트의 행동이 타겟 정책과 일치하도록 유도하는 손실 함수를 사용해 훈련된다.
  • 읽기 전용 액세스 가정 하에 작동하며, 에이전트의 관측값만 수정 가능하고 내부 표현이나 가중치는 수정 불가능하다.
  • 공격는 추론 시점에서 즉각적으로 추론되어 실시간 적용이 가능하다.
  • 동일한 최적화 프레임워크를 사용하여 VGG16 기반으로 ImageNet에 대한 일반화된 적대적 예제 생성을 통해 방법을 확장한다.

실험 결과

연구 질문

  • RQ1딥 강화학습 에이전트의 관측값만 변경함으로써 내부 상태에 쓰기 액세스 없이도 타겟된 실시간 적대적 공격를 구성할 수 있는가?
  • RQ2다양한 환경과 관측값에서 일관되게 타겟 정책의 행동을 유도할 수 있는 유한한 수의 일반화된 마스크를 사전에 계산할 수 있는가?
  • RQ3CopyCAT은 백색 상자에서 검은 상자 설정으로의 전이 효과가 얼마나 높은가? 특히 타겟 정책이 알려지지 않거나 접근 불가능한 경우에도 그렇다.
  • RQ4실제 이미지 입력인 ImageNet과 같은 경우에 일반화된 적대적 예제를 생성할 수 있으며, 고차원 관측 공간에서도 효과를 유지하는가?
  • RQ5이 방법의 성공 여부는 정책의 결정 경계의 구조와 타겟 정책 및 소스 정책 간 유사성에 얼마나 의존하는가?

주요 결과

  • CopyCAT은 읽기 전용 관측 공격 설정에서도 Atari 2600 게임에서 훈련된 DQN 에이전트를 높은 정확도로 타겟 정책을 따르도록 성공적으로 이끌었다.
  • 'tiger_shark' 클래스를 대상으로 ImageNet에서 훈련 정확도 90%와 테스트 정확도 88.44%를 달성하여 현실적인 이미지에서 일반화된 적대적 예제 생성의 타당성을 입증했다.
  • 사전에 계산된 마스크는 추가 지연 없이 실시간 추론을 가능하게 하여 온라인 실시간 배포에 적합하다.
  • 초기 검은 상자 평가에서도 공격가 효과를 유지하여 알려지지 않거나 접근 불가능한 정책으로의 전이 가능성 잠재력을 보여준다.
  • ImageNet에서 일반화된 적대적 예제의 존재는 CopyCAT의 적용 범위가 Atari 유사 환경을 넘어 복잡한 현실 세계의 시각적 입력으로까지 확장됨을 확인한다.
  • 결과는 에이전트의 내부 상태가 보호되어 있어도 관측 수준의 조작에 취약한 딥 강화학습 에이전트의 취약성을 드러낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.