Skip to main content
QUICK REVIEW

[논문 리뷰] PolicyCleanse: Backdoor Detection and Mitigation in Reinforcement Learning

Junfeng Guo, Ang Li|arXiv (Cornell University)|2022. 02. 08.
Adversarial Robustness in Machine Learning인용 수 4
한 줄 요약

PolicyCleanse는 다중 에이gent 경쟁 강화 학습에서 백도어 탐지 및 완화를 위한 새로운 프레임워크를 제안하며, 공격자 행동 시퀀스에 의해 유도되는 보상 감소를 활용하여 트로이 목마 트리거를 식별한다. 이는 기존 기준 대비 3% 이상 승리율 향상으로 뛰어난 탐지 정확도를 달성한다.

ABSTRACT

While real-world applications of reinforcement learning are becoming popular, the security and robustness of RL systems are worthy of more attention and exploration. In particular, recent works have revealed that, in a multi-agent RL environment, backdoor trigger actions can be injected into a victim agent (a.k.a. Trojan agent), which can result in a catastrophic failure as soon as it sees the backdoor trigger action. To ensure the security of RL agents against malicious backdoors, in this work, we propose the problem of Backdoor Detection in a multi-agent competitive reinforcement learning system, with the objective of detecting Trojan agents as well as the corresponding potential trigger actions, and further trying to mitigate their Trojan behavior. In order to solve this problem, we propose PolicyCleanse that is based on the property that the activated Trojan agents accumulated rewards degrade noticeably after several timesteps. Along with PolicyCleanse, we also design a machine unlearning-based approach that can effectively mitigate the detected backdoor. Extensive experiments demonstrate that the proposed methods can accurately detect Trojan agents, and outperform existing backdoor mitigation baseline approaches by at least 3% in winning rate across various types of agents and environments.

연구 동기 및 목표

  • 공격자가 상대방 행동을 통해 트리거를 삽입하는 다중 에이전트 경쟁 강화 학습(CRL) 환경에서 증가하는 보안 위험을 해결하기 위해.
  • 공격자로부터 특정 행동 시퀀스를 노출받을 때 치명적인 실패를 겪는 트로이 에이전트를 탐지하기 위해.
  • 기계적 미학습 기반 재학습 접근법을 통해 탐지된 백도어를 완화하기 위해.
  • CRL 환경에서 알려지지 않은, 가변 길이의 연속 행동 트리거 문제를 해결하기 위해.
  • 탐지 회피를 위해 실패 속도를 느리게 조작하는 적응형 공격에 대비한 강건성을 확보하기 위해.

제안 방법

  • PolicyCleanse는 피해자 에이전트의 보상 감소가 급격히 발생하는 행동 시퀀스를 식별하기 위해 반전 보상 정책 최적화를 통해 백도어를 탐지한다.
  • 기대 누적 보상에 대한 이진 탐색을 통해 트리거 행동 시퀀스를 국소화하며, 반복적으로 임계값 범위를 좁힌다.
  • 다양한 환경에서 탐지 성공률를 높이기 위해 랜덤 초기화를 활용한 병렬 정책 최적화를 적용한다.
  • 일시적 트리거가 식별된 후, 정상 및 일시적 트리거 경로가 혼합된 데이터셋을 기반으로 피해자 정책을 재학습하여 트로이 행동을 미학습한다.
  • 기존 기준 대비 승리율에서 뛰어난 성능을 발휘하는 기계적 미학습 기반 완화 전략을 적용한다.
  • 공격자가 탐지 회피를 위해 실패 메커니즘을 수정하는 적응형 공격 환경에서 평가하여 실제 세계의 회피 시도를 시뮬레이션한다.

실험 결과

연구 질문

  • RQ1경쟁적 강화 학습에서 피해자 에이전트가 특정 상대 행동을 만날 경우 비정상적인 보상 감소를 관찰함으로써 백도어 트리거를 탐지할 수 있는가?
  • RQ2PolicyCleanse는 다양한 CRL 환경과 에이전트 아키텍처에서 백도어 탐지에 얼마나 효과적인가?
  • RQ3제안된 완화 전략은 기존 기준 대비 피해자 에이전트의 성능을 얼마나 복원하는가?
  • RQ4실패 반응 속도를 느리게 조절하여 탐지를 회피하려는 적응형 공격 상황에서 PolicyCleanse는 어떻게 성능을 발휘하는가?
  • RQ5탐지 메커니즘은 자연적인 에이전트 행동과 인위적인 백도어 트리거를 구분할 수 있는가?

주요 결과

  • PolicyCleanse는 네 가지의 다른 경쟁 환경과 다수의 에이전트 아키텍처에서 트로이 에이전트를 고정정확도로 모두 탐지하였다.
  • 모든 평가 환경에서 기존 백도어 완화 기준 대비 최소 3% 이상 승리율 향상을 기록하였다.
  • 탐지를 회피하기 위해 실패 속도를 느리게 조정하는 적응형 공격은 표준 BackdooRL 대비 공격 효과를 최소 19.6% 감소시켰다.
  • 검출된 일시적 트리거는 정상 행동과 구별되며, 자연적 에이전트 행동의 산물이 아니라는 점이 부가 분석과 시각화를 통해 확인되었다.
  • 미학습 기반 완화 전략은 에이전트 성능을 효과적으로 복원하였으며, 피해자 에이전트는 강력한 경쟁 능력을 회복하였다.
  • 적응형 공격이 탐지를 회피하더라도 실패 속도가 상당히 느려져 은폐성과 실제 세계에서의 타당성이 크게 감소하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.